Класифікація проти сегментації: Розпізнавання фото vs. Виклад усього в ньому
Стандартний класифікатор зображень дивиться на все фото та видає єдину мітку, наприклад "кіт", стискаючи мільйони пікселів до одного рішення. Семантична сегментація ж запитує мережі розмітити кожен окремий піксель за класом, в якому він належить, створюючи повну карту, яка відокремлює шерсть кота від дивана та стіни позаду нього. Це набагато складніше, оскільки мережі необхідно зберігати точні просторові деталі, одночасно розуміючи високорівневий контекст, такий як "це згрупування пікселів є твариною", два завдання, які зазвичай суперечать одна одній. Помилки в межах кількох пікселів мають величезне значення у таких застосунках, як контурування пухлини, де саме край має вирішальне клінічне значення.
Архітектура: Стиснений Кодувальник Зустрічає Розширеного Декодувальника
U-Net складається з двох дзеркальних частин. Кодувальник (стиснутий шлях) повторно застосовує конволюції та обрізання, щоб зменшити зображення просторово, одночасно збільшуючи кількість каналів ознак, видобуваючи поступово більш абстрактні шаблони від країв до текстур до частин об'єктів. Декодувальник (розширений шлях) потім змінює цей процес, використовуючи згортку та збільшення роздільної здатності, щоб розширити стисну представлення назад до початкового роздільного співвідношення. Сам по собі стиснений кодувальник-декодувальник втратить занадто багато деталей, що є проблемою, яку наступна особливість U-Net вирішує.
Пропускні зв’язки: таємниця форми ‘У’
Ключовою інновацією U-Net є набір пропускальних зв’язків, які копіюють карти ознак, що вироблені на кожному рівні декодера, безпосередньо до відповідного рівня декодера, конкатенуючи їх із піднятими вгору ознаками. Це дозволяє декодеру об'єднувати грубі, високоякісні семантичні розуміння глибоких шарів із чітким, високою роздільною здатністю просторовою деталізацією, захопленою на ранніх етапах кодувальника, такою як точні межі об’єктів, які в іншому випадку були б знищені повторним зменшенням розміру. Проходячи вниз по шляху кодувальника, назад по шляху декодера та цими горизонтальними пропускальними зв’язками між ними, відтворюється форма ‘У’, що дає архітектурі її назву. Без цих з’єднань сегментаційні карти схильні до того, що вони будуть розмитими та невідповідними на межах; із ними межі залишаються чіткими.
З медичних сканів до супутників і моделей дифузії
U-Net був представлений Олафом Роннебергером, Піппом Фішером та Томасом Брок у 2015 році спеціально для сегментації біомедичних зображень, де обмежені та дорогого стоять розмічені навчальні дані, оскільки вони вимагають експертної анотації клітин, органів або пухлин у мікроскопічних та сканувальних зображеннях. Його ефективне використання обмежених даних у поєднанні з інтенсивним збільшенням даних дозволило йому виграти завдання сегментації лише за кілька десятків навчальних зображень. Дизайн виявився настільки ефективною та загальною, що він поширився далеко за межі медицини, для сегментування супутників і аерозолів для картографії використання землі, живлення систем сприйняття в автономних автомобілях і є основним блоком шумоподавлення всередині багатьох сучасних моделей генерації зображень на основі дифузії.
Frequently asked questions
Чому U-Net має форму літери "U"?
Це тому, що його архітектурний діаграма буквально утворює цю форму: шлях кодера спускається зліва під час зменшення роздільної здатності зображення, а шлях декодера піднімається справа при її повторному збільшенні до повної роздільної здатності, а горизонтальні з’єднання зв’язують відповідні рівні в середині. Візуальне розташування мережі безпосередньо дало їй назву.
Яку проблему вирішують skip connections?
Під час зменшення роздільної здатності мережа відкидає тонкі просторові деталі, такі як точні краї, натомість отримуючи компактне, високорівне розуміння вмісту зображення. Skip connections повторно впроваджують цю втрачену деталь з кожного етапу кодера безпосередньо у відповідний етап декодера, щоб кінцевий вихід піксельного рівня був одночасно семантично правильним і просторово точним.
Чи все ще використовується U-Net сьогодні, чи його замінили?
U-Net залишається широко використовуваним і розширений у безліч варіацій (таких як 3D U-Net та Attention U-Net), особливо в медичній візуалізації, де його ефективність використання даних є цінною. Він також знайшов несподіване друге життя як стандартна основна частина дифузійних моделей, таких як ті, що лежать в основі популярних генераторів зображень, які повторно видаляють шум з зображення за допомогою U-Net на кожному кроці.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте U-Net: Pixel-Perfect Image Segmentation і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію U-Net: Pixel-Perfect Image Segmentation