🌐 Оцінювач якості перекладу — вирівнювання ембеддингів наживо
Оцінюйте якість пар речень машинного перекладу за допомогою справжнього крос-мовного вирівнювання ембеддингів, спостерігаючи, як показник впевненості відслідковує тонкий дрейф значення в реальному часі.
Про цю симуляцію
Системи машинного перекладу видають результат за мілісекунди, але зрозуміти, чи можна цьому результату довіряти — окрема, складніша задача, яку зазвичай вирішує оцінка якості перекладу (QE), що оцінює переклад без потреби в еталонному перекладі людини. Ця симуляція будує невеликий, повністю прозорий конвеєр QE: вихідні та перекладені слова розміщуються у спільному синтетичному просторі ембеддингів, де справжні пари перекладів лежать близько одна до одної, вектори речень формуються усередненням ембеддингів слів (і пар слів), а показник якості — це справжня косинусна подібність між двома векторами речень, точно те саме порівняння, яке виконують реальні метрики QE на основі ембеддингів.
🔬 Що показано
Шість пар вихідне/перекладене речення, кожне слово яких відображене у детермінований 20-вимірний вектор. Слово та його правильний переклад — це зашумлені копії того самого спільного вектора «концепції» — іграшковий замінник крос-мовного вирівнювання ембеддингів. Живий розсіювальний графік PCA проєктує кожен вектор слова на два напрямки найбільшої дисперсії; пунктирна лінія між двома більшими точками-центроїдами — це відстань вирівнювання на рівні речення, а нижній графік відслідковує результуючий показник якості 0–100 з часом.
🎮 Як користуватись
Оберіть пару речень, потім тягніть повзунок величини дрейфу, коли обрано режим дрейфу — Заміна, Перестановка або Пропуск, — і спостерігайте, як показник якості, косинусна подібність і розсіювання PCA миттєво реагують. «Перегенерувати патерн дрейфу» перевипадковлює, які слова зачіпаються на кожному рівні дрейфу; «Анімувати дрейф» автоматично гойдає величину вгору-вниз, щоб можна було побачити, як графік тренду показника вибудовує повну історію.
💡 Чи знали ви?
Оскільки вектор речення — це усереднення «мішка ембеддингів», чиста перестановка (збереження всіх слів, але перетасовування їх позицій) погіршує показник значно менше, ніж заміна чи видалення значущих слів — та сама асиметрія, яку видно в реальних метриках MT на основі ембеддингів, які набагато краще вловлюють помилковий переклад значення, ніж самостійно карають за порядок слів.
Часті питання
Що таке оцінка якості перекладу (QE)?
Оцінка якості перекладу передбачає, наскільки хороший машинний переклад, без доступу до еталонного перекладу людини. Реальні системи QE (такі як COMET-QE чи OpenKiwi) пропускають вихідне речення та машинний переклад через багатомовний енкодер і порівнюють отримані ембеддинги — речення з однаковим значенням опиняються близько одне до одного у спільному просторі ембеддингів, тоді як неправильні переклади розходяться. Ця симуляція будує невелику, прозору версію тієї самої ідеї: синтетичні ембеддинги слів, спільний крос-мовний простір концепцій і справжній показник косинусної подібності.
Як тут працює синтетичний простір ембеддингів?
Кожна словесна концепція отримує детермінований 20-вимірний вектор, згенерований із хешу за початковим значенням його назви. Слово вихідної мови та його правильний переклад обидва будуються шляхом додавання незалежного невеликого шуму до того самого спільного вектора концепції — імітуючи те, як реальне крос-мовне вирівнювання ембеддингів (наприклад, MUSE, LASER або відображення, індуковане двомовним словником) розміщує справжні пари перекладів близько одна до одної, попри те, що це різні поверхневі слова. Непов’язане слово-відволікач отримує власний незалежний вектор, тож заміна на неправильне слово змушує вектор перекладу відхилятися від оригіналу.
Як обчислюється вектор речення з векторів слів?
Кожен вектор речення — це зважене середнє його векторів слів (80%) та векторів сусідніх пар слів, або біграм (20%). Усереднення векторів слів — це класичне представлення речення «мішком ембеддингів»; додавання векторів біграм надає представленню певної чутливості до порядку слів, оскільки перестановка слів змінює, які біграми з’являються, навіть якщо ті самі слова все ще присутні. Це той самий компроміс між простотою та чутливістю до порядку, який роблять реальні речові ембеддинги у стилі fastText чи SIF.
Що насправді вимірює показник якості?
Показник якості — це косинусна подібність між вектором вихідного речення та вектором речення перекладу, перемасштабована з типового діапазону −0,5…0,9 у шкалу 0–100. Косинусна подібність вимірює кут між двома векторами незалежно від їхньої довжини, що є саме тим порівнянням, яке використовують метрики QE на основі ембеддингів для порівняння значення, ігноруючи поверхневі відмінності масштабу. Достовірний переклад тримає цей кут малим (високий показник); заміна, пропуск чи перестановка достатньої кількості слів розширює кут, і показник падає в реальному часі, коли ви рухаєте повзунок дрейфу.
Чому заміна, перестановка та пропуск по-різному впливають на показник?
Заміна слова замінює його вектор на непов’язаний, різко відтягуючи середнє від оригіналу — уже кілька замін показують велике падіння. Пропуск слів стискає середнє речення до того, що залишилось, що також погіршує показник, коли бракує достатньо контенту, але одне пропущене службове слово важить менше. Перестановка залишає вектор кожного слова в середньому речення незмінним, тож вона проявляється лише через компонент біграм — реальне відображення того, чому метрики у стилі мішка слів менш чутливі до порядку слів, ніж до фактичного неправильного перекладу змісту.
Що показує проєкція PCA на верхній панелі?
Верхня панель бере кожен вектор слова в поточних вихідному та перекладеному реченнях (усі 20-вимірні) і проєктує їх на 2 напрямки найбільшої дисперсії за допомогою методу головних компонент, обчисленого наживо через степеневу ітерацію на коваріаційній матриці. Це та сама техніка зниження розмірності, що використовується для візуалізації реальних ембеддингів слів і речень (наприклад, побудова графіків векторів BERT чи word2vec). Дві більші точки — це центроїди речень; пунктирна лінія між ними — візуальний аналог відстані вирівнювання, показаної на панелі статистики.
Чи так насправді працюють виробничі системи QE машинного перекладу?
Основний механізм — порівняння ембеддингів вихідного тексту та перекладу за допомогою косинусної подібності у спільному крос-мовному просторі — це справді те, як працюють безеталонні системи QE та крос-мовного пошуку. Що тут спрощено, так це сам ембеддинг: виробничі системи використовують глибокі багатомовні трансформерні енкодери, натреновані на мільярдах слів, тоді як ця симуляція використовує невеликі детерміновані псевдовипадкові вектори, щоб увесь конвеєр залишався доступним для перевірки та відтворюваним у браузері. Проте математика вирівнювання, усереднення та косинусного порівняння — справжня.