Архітектури
Візуальні енкодери (ViT), проєкційні адаптери до мовного простору, спільні простори ембедінгів, MoE-гейти.
Навчання
Pretrain на парних даних, інструкційне донавчання, captioning/VQA задачі, дані високої якості і баланс модальностей.
Інференс
Контекстні вікна, стиск зображень до токенів, безпечні фільтри, стрімінг відео, вікна уваги.
Гайд з прикладами
Приклад: Додавання візуального адаптера
Вибрати ViT-базу і проєкційний шар у мовний простір.
Донавчити на VQA/Caption наборах з mixup/augment.
Валідувати на мультимодальних бенчмарках.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Hash Function Avalanche Visualizer і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Hash Function Avalanche Visualizer