Спільний Простір для Зображень та Слів
В основі CLIP лежить проста, але потужна ідея: перетворювати як зображення, так і текст на вектори, або ембеддинги, які живуть у одному багатовимірному просторі. Для цього використовуються дві окремі нейронні мережі – одна для зображень та інша для тексту, але вони навчаються таким чином, щоб отримані вектори були безпосередньо порівнюваними. Якщо зображення та його підпис описують одне й те саме, їх ембеддинги повинні вказувати майже в одному напрямку, тому проста оцінка подібності, така як косинус кута між ними, повідомляє моделі, наскільки добре зображення та фраза відповідають один одному. Непов'язані пари, наприклад, фото собаки з підписом «тарілка пасти», опиняться далеко один від одного в цьому просторі.»
Навчання на основі контрасту: InfoNCE в дії
CLIP не навчається на одній парі зображення-підпису одночасно. Замість цього, він обробляє цілу партію таких пар – наприклад, 256 зображень і їхніх 256 справжніх підписів – та кодує кожне зображення та кожен підпис у вектори. Потім він створює повний матрицю оцінок подібності між кожним зображенням та кожним підписом у партії, а мережі навчаються таким чином, щоб справжні підписи кожного зображення мали вищі оцінки, ніж усі інші підписи в цій партії, а справжні зображення кожного підпису – вищі оцінки, ніж усі інші зображення в цій партії. Це і є втрата контрасту InfoNCE: вона винагороджує правильні пари та одночасно штрафує кожну невідповідну комбінацію, що значно більш інформативно на кожен етап навчання, ніж просто говорити «ця пара відповідає» або «ця пара не відповідає».
Чому Шумні Інтернет Дані Стали Існим Проривом
Традиційні класифікатори зображень навчалися на ретельно розмічених наборах даних із фіксованим, обмеженим набором категорій, таких як 1000 класів ImageNet. CLIP навчився на приблизно 400 мільйонах пар зображення-підписи, зібраних з відкритих інтернет-ресурсів, де підписи є нечіткими, неформальними та охоплюють величезний спектр концепцій, стилів і формулювань. Оскільки модель навчається пов'язувати зображення з природною мовою замість жорсткого списку міток, вона виявляє набагато більш багату нотацію візуальних понять і може узагальнювати до категорій, які не мала явних прикладів під час навчання. Це дає CLIP сильні результати з нульовим промінням: під час тестування ви просто описуєте нову категорію словами, а модель порівнює зображення з цими текстовими описаннями без додаткового навчання.
Від наукової ідеї до інструменту ШІ для повсякденного використання
Цей тип спільного простору вкладення тепер лежить в основі нульового навчання класифікації зображень, генерації зображень з тексту та пошуку за зображеннями та текстом, модерації контенту, а також надає «керуючий» сигнал, який направляє генератори зображень з тексту, такі як DALL-E та Stable Diffusion, до запитів. Однак цей підхід успадковує будь-які упередження та стереотипи, присутні в даних, зібраних із інтернету, його продуктивність може бути дивно чутливою до того, як сформульовано запит, і відповідність підпису зображенню не є справжнім розумінням ні одного з них. Дослідники та інженери, які розгортають ці вкладення, повинні активно перевіряти наявність цих «сліпих плям», а не припускати, що модель міркує так само, як людина.
Frequently asked questions
Чи CLIP це те саме, що генератор зображень, як DALL-E?
Ні. CLIP сам по собі лише вчиться вимірювати, наскільки добре зображення та текст відповідають один одному, він не генерує зображення. Однак його ембеддінги широко використовуються як сигнал керівництва всередині систем генерації зображень, допомагаючи їм оцінювати, чи відповідає згенероване зображення текстовому запиту.
Чому його називають "контрастивним" навчанням?
Тому що сигнал навчання походить від порівняння правильності пари із багатьма неправильними парами в межах однієї партії, а не просто маркування окремих прикладів як правильні чи неправильні. Модель навчається представляти інформацію, будучи змушеною розрізняти справжню відповідність від набору відволікаючих факторів.
Чи може CLIP розпізнавати щось, чого не було явно навчено?
Часто так, до вражаючої міри. Оскільки він навчався на такому широкому та різноманітному наборі природних текстових підписів, а не на фіксованому наборі міток, він може порівнювати нове зображення з будь-якими текстовими описаннями та часто правильно ідентифікує концепції, які він ніколи не бачив під час навчання, властивість, відома як нульова генералізація.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Contrastive Image-Text Embedding: How CLIP Learns to Match Pictures and Words і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Contrastive Image-Text Embedding: How CLIP Learns to Match Pictures and Words