Метрики та набори даних
Показники Recall@k, precision@k та nDCG
Важкі негативи та побудова наборів даних
Переранжування
Крос-коди та моделі типу списку оцінюють якість з урахуванням затримки. Розглядається компроміс між цими факторами.
Оцінка та Переранжування Відбору
Початково, ми використовуємо фільтр BM25 для вилучення релевантних документів. Після цього, застосовується пошук за вкладеннями (embedding retrieval) для подальшого уточнення результатів.
Для більш точної оцінки та підвищення якості, ми застосовуємо крос-кодерування (cross-encoder reranking), використовуючи обмежений бюджет. Це дозволяє нам врахувати контекстні особливості запиту та документів.
Оцінюючи покращення у задачах Question Answering (QA) та вимірюючи затримку, ми переконаємося в ефективності запропонованого підходу.
Часті запитання
Скільки фрагментів (chunks)?
Збалансуйте якість та бюджет контексту.
Зміщення домену (domain shift)?
Перенавчіть вкладення (embeddings) та переранжувачі (rerankers).
Оцінка (Evaluation)?
Використовуйте показники офлайн та онлайн A/B тестування.
Свіжість (Freshness)?
Використовуйте інкрементний індексування та TTLs.
Персоналізація (Personalization)?
Використовуйте сигнали та фільтри, орієнтовані на орендаря (tenant-aware).
Мультимовність (Multi-lingual)?
Використовуйте мовні моделі специфічні для мови або зорієнтовані на вирівнювання (aligned models).
Безпека (Security)?
Впроваджуйте контроль доступу в процесі пошуку (retrieval).
Моніторинг (Observability)?
Відстежуйте запити та закономірності hit/miss.
Вартість (Costs)?
Кешуйте популярні запити та оцінки (scores).
Галюцинації (Hallucinations)?
Покращуйте пошук та вимагайте цитування (citations).
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Hash Function Avalanche Visualizer і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Hash Function Avalanche Visualizer