Чому автоматичне виявлення королеви є справді складною задачею для комп’ютерного зору
Королева бджоли на перший погляд схожа на робітника, відрізняючись головним чином довшою брюхом та іншим ходом, а не різницею у кольорі, особливо якщо королеву штучно позначено кольоровою крапочкою, що часто роблять пасічники для полегшення візуального розпізнавання. У типовому кадрі, наповненому тисячами робітників, які постійно рухаються, королева є невеликою, часто частково закритим об’єктом серед величезної кількості схожих за зовнішнім виглядом об’єктів – це і є задача «свиня в сіні», яка становить серйозну проблему навіть для добре навчених моделей. Це набагато складніше, ніж задача підрахунку входу, де кожен виявлений об'єкт приблизно відповідає тому, що ви шукаєте; тут переважна більшість виявлень явно не є цільовим об’єктом.
Практична цінність вирішення цієї задачі надійно є реальною: автоматичне виявлення королеви може заощадити досвідчених пасічників значний час під час звичайних оглядів та допомогти новачкам, які мають труднощі з візуальним розрізненням королеви. Однак поки що не існує широкодоступного продукту, який би надійно виконував цю задачу в усіх умовах освітлення та ситуаціях у пасіці, повністю замінюючи досвідченого ока.
Моделі підходів та їхні компроміси
Досліджено три основних підходи до моделювання цієї проблеми, кожен з яких має свої особливості та компроміси. Об'єктивне виявлення, наприклад, YOLOv8 або варіанти SSD, пропонують швидке інференсування, яке підходить для практично реального часу, але потребують значної кількості розмічених даних для досягнення високої точності через рідкість та візуальну тонкість королеви порівняно з робітниками. Підходи сегментації, такі як Mask R-CNN, забезпечують більш токе локалізацію на рівні пікселів, що корисно для підтвердження позитивного виявлення з більшою впевненістю, але за рахунок збільшених обчислювальних вимог, які ускладнюють реальне інференсування на обладнанні середнього рівня. Моделі на основі ключових точок або поз забезпечують найменш розвинений підхід, але потенційно найбільш стійкий до візуального закриття, оскільки використовують поведінкові сигнали робітників як допоміжний сигнал замість повної залежності від прямого спостереження тіла королеви.
На практиці багато робочих систем поєднують підходи: швидкий детектор пропонує підозрілі області, а менший, більш уважний класифікатор підтверджує або відхиляє кожну підозру, балансуючи між швидкістю та необхідною точністю для запобігання надмірній кількості хибнопозитивних результатів, що швидко дратує користувача, якщо система постійно маркує робітників як королеву.
Побудова набору даних, який дійсно узагальнює
Оскільки матки є рідкісними порівняно з робітниками на будь-якому кадрі, якість набору даних має більше значення, ніж його обсяг, для цієї конкретної задачі. Рекомендована практика включає зйомку при посвітленому, контрольованому освітленні, оскільки тінь і відблиски значно впливають на надійність виявлення, навмисне включення різноманітних підвидів та кольорових забарвлень, оскільки модель, навчена лише на позначених матках одного типу, може не спрацювати на немаркованих матках іншого типу, а також розмітку складних негативних прикладів – щільних кластерів робітників, які з певних кутів схожі на маточну візерунок, щоб навчити модель, чого не є мати, а не тільки того, що вона є.
Критичний і часто недооцінений крок – розділення даних для навчання та валідації за колоніями або пасіками, а не випадкове розподілу всіх зібраних зображень, оскільки випадкове розділення кадрів з однієї сесії в гнізді ризикує тим, що модель ефективно запам'ятає специфічні візуальні особливості цього гнізда, освітлення та зовнішній вигляд матки, а не навчиться справжньому узагальнювальному шаблону виявлення, що призводить до оманливо високої точності при тестуванні, яка потім не витримує критики на новій, невидимій колонії.
Реалії розгортання та етичне поводження з даними
Варіанти розгортання відображають ті, що зустрічаються в інших проектах комп’ютерного зору для паліток: легкі моделі, перетворені у формати, такі як TFLite або ONNX, можуть працювати безпосередньо на невеликій платі, прикріпленій до механізму зйомки зображень для майже реального часу, пакетна обробка через хмарний API підходить палівальникам, які задоволені переглядом результатів після завершення, а гібридні системи дозволяють здійснювати збір даних на пристрої та запускати більш важкі висновки віддалено. Наразі жоден із цих підходів не підтримує повністю невимушеного сценарію «подивись у камеру і зроби фото» з високою надійністю; більшість практичних розгортань все ще передбачають спеціалізований механізм зйомки зображень із контрольованим та послідовним кадром.
Збір даних також піднімає важливі етичні та питання щодо згоди, які варто серйозно розглядати: отримання згоди від власників палиць перед обміном зображеннями об’єктів до них, розмиття будь-яких випадково зафіксованих облич або номерних знаків транспортних засобів на задньому плані фотографій палиць, а також чітке формулювання умов ліцензування при внеску в або використанні спільних публічних наборів даних, оскільки комп’ютерне зору для паліток все більше будується спільно багатьма палицями-учасниками.
Часті запитання
Чи може комп’ютерне бачення надійно знаходити немарковану матку сьогодні?
Надійність покращується, але залишається недосконалою, особливо для немаркованих меток під змінними умовами освітлення. Марковані метки з видимим кольоровим крапочкою значно легше помітити як моделями, так і людьми, а більшість робочих систем найкраще працюють у контрольованих та послідовних умовах зображення, ніж при випадкових знімках на телефоні.
Чому розділення набору даних для виявлення меток за колонією є важливим?
Якщо навчальні та тестові зображення походять з однієї пасіки, випадково розділені, модель може ефективно запам’ятати конкретне освітлення та зовнішній вигляд цієї пасіки, а не навчитися загальних ознак виявлення меток, що призводить до оманливо хороших результатів тестування, які не працюють на справжній новій колонії.
Що таке 'тверда негативна' в даних для навчання виявлення меток?
Це область зображення, яка на перший погляд схожа на метку, така як щільний кластер роїв під певним кутом, але навмисно позначена як не-метка. Включення цих навчає модель розрізняти більш точно, а не просто розпізнавати загальну форму.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте the simulation і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію the simulation