Чому рентгенівські знімки грудної клітки – це природний вибір для комп’ютерного зору
Пневмонія залишається однією з найпоширеніших причин госпіталізації у всьому світі, а рентгенівський знімок грудної клітки зазвичай є першим візуалізаційним тестом, який замовляє лікар, коли підозрюють її наявність. На нормальному рентгенівському знімку грудної клітки здоровий легенічний тканин переважно темні (повітря мало впливає на рентгенівські промені), а пневмонія зазвичай проявляється у вигляді плям підвищеної непрозорості – біліших, хмарніших областей, де інфекція заповнила порожнини легень рідиною та запальними клітинами. Це справді завдання розпізнавання візуальних шаблонів, для яких і будуються згорткові нейронні мережі: вони безпосередньо навчаються, на основі тисяч розмічених прикладів зображень, що виглядає «інфікований легені» порівняно з «чистим легенем», не потребуючи ручного кодування відповідних радіологічних правил.
Будівництво та порівняння двох різних мереж
Корисною є можливість побачити, що трансферне навчання дає вам, – це побудувати дві моделі поруч одна з одною на одній і тій же масив даних рентгенівських знімків грудної клітки. Перша – це спеціалізована CNN, зібрана з нуля: стовпчики Conv2D для вилучення локальних візуальних ознак, MaxPooling для прогресивного зменшення зображення, зберігаючи найважливіші сигнали, batch нормалізація для стабілізації навчання та dropout для зменшення перенавчання, все це було навчено з випадкового початкового пункту лише на масиві даних із пневмонією. Друга використовує VGG16 – добре відому архітектуру, попередньо навчену на 14-мільйонному масиві зображень ImageNet, з її конволюційним шаром, збереженим, і заміненими та відшліфованими останніми класифікаційними шарами спеціально для завдання нормальне-пневмонія. Оскільки VGG16 вже знає, як виявляти загальні візуальні ознаки, такі як краї, текстури та форми, завдяки навчанню на ImageNet, то зазвичай потребує значно менше специфічних даних для досягнення сильної продуктивності, ніж мережа, що починається з нуля – це справді важлива перевага в медичній візуалізації, де великі розмічені масиви даних дорогі та повільні у створенні.
Правила збільшення обсягу даних, що враховують анатомію
Стандартні методи збільшення обсягу даних – невеликі повороти, зміни яскравості та контрасту, зум – допомагають моделі узагальнювати на рентгенівських знімках, зроблених різним обладнанням, різними параметрами експонування та з дещо іншим положенням пацієнта, по суті, множаючи розмір і різноманітність навчального набору без збору жодного нового зображення. Але не всі методи збільшення обсягу даних мають сенс для рентгенівського знімка грудної клітки: горизонтальне перевертання прийнятне, оскільки грудна клітка приблизно симетрична щодо лівого та правого боків, але вертикальне перевертання свідомо уникається, оскільки перевернутий рентгенівський знімок грудної клітки не є фізіологічно реалістичним зображенням і просто навчить модель спотвореної, непотрібної версії анатомії легень. Цей тип доменно-орієнтованого обмеження є гарним прикладом того, чому медичні пірінгів не можуть просто запозичувати загальні рецепти комп’ютерного зору – стратегія збільшення обсягу даних має враховувати те, що анатомічно та клінічно правдоподібно.
Чутливість є показником, який насправді має значення
Після навчання генерується низка показників: точність, прецизійність, чутливість (recall), F1-оцінка, специфічність та площа під ROC кривою. У контексті медичного скринінгу ці показники не є взаємозамінними, і чутливості заслуговує на особливу увагу. Якщо пацієнта з пневмонією не виявляється (хибнонегативний результат), лікування відкладається – це серйозний клінічний наслідок. Якщо здорового пацієнта позначено для подальшого розгляду, і це виявляється непотрібним (хибнопозитивний результат), це незручність та витрата часу медичного персоналу, але це набагато менш серйозна помилка. Ця асиметрія пояснює, чому в діагностичному скринінгу команди навмисно налаштовують моделі для досягнення високої чутливості, навіть якщо це призводить до незначної втрати специфічності, і чому одне число точності, повідомлене само по собі, може ввести в оману щодо безпеки моделі при її розгортанні.
Grad-CAM: перевірка того, на що дивиться модель
Високий показник чутливості сам по собі не доводить, що модель засвоїла будь-які медийно значущі речі — вона теоретично може виявляти будь-яке нерелевантне артефакт, таке як специфічний маркер лікарні, який випадково корелює з міткою пневмонії в навчальних даних. Grad-CAM вирішує цю проблему, відстежуючи градієнти, що протікають назад від остаточної прогнозу моделі через її останній згортковий шар, створюючи теплову карту, яка підкреслює саме ті пікселі, які найбільше вплинули на рішення. Для надійної класифікації пневмонії ця теплова карта повинна послідовно спалювати (підсвічувати) області легень, особливо області з непрозорістю, на які вказував би рентгенолог – не кути зображення, не текстові надписи, не діафрагма. Цей тип перевірки пояснюваності також стає все більш очікуваним регуляторами: прозорість щодо того, як штучний інтелект досягає своїх діагностичних висновків, розглядається як необхідна умова для довіри клініки, а не як додаткова опція.
Чого це може і чого не може зробити для Національної служби охорони здоров’я
Реалістично, модель такого типу – навчена на одному публічному наборі даних з однієї лікарні в Гуанчжоу – є надійною демонстрацією основної техніки, але далеко від того, щоб безпосередньо підтримувати радіологічну практику NHS. Будь-які достовірні клінічні застосування будуть виконуватися як шар підтримки рішень: допомагаючи тривожній оцінці та пріоритетності списку читання рентгенолога в завантаженому відділенні, або надаючи швидкий перший перегляд у умовах обмежених ресурсів, завжди з остаточною відповіддю від лікаря-рентгенологи. Також потрібно буде перенавчати та валідувати модель на даних, зібраних у кількох лікарнях Великої Британії та системах візуалізації, оскільки модель, навчена однією популяцією та одним набором рентгенівських апаратів, може значно гірше працювати при зустрічі з іншими даними – добре задокументований спосіб невдач у медичному штучному інтелекті загалом.
Часті запитання
Що таке пневмонія на рентгенівському знімку грудної клітки?
Області легенів, уражені пневмонією, зазвичай виглядають як плями підвищеної непрозорості або білизною порівняно з нормальною темною тканиною легенів, що заповнена повітрям, оскільки інфекція заповнює найдрібніші повітряні просвіти рідиною та запальними клітинами, які більше поглинають рентгенівські промені, ніж повітря.
Чому порівнювати власну CNN з моделлю transfer learning, наприклад, VGG16?
Це ілюструє ключовий урок у медичній обробці зображень штучним інтелектом: попередньо навчені мережі, такі як VGG16, вже знають загальні візуальні ознаки з величезного непов’язаного набору даних, тому вони зазвичай досягають високої точності з набагато меншою кількістю специфічних для завдання навчальних даних, ніж мережа, побудована повністю з нуля.
Чому чутливість має значення більше, ніж загальна точність при скринінгу на пневмонію?
Оскільки пропуск справжнього випадку пневмонії (хибно негативний результат) затримує лікування та несе значно вищий клінічний ризик, ніж хибний сигнал, який просто спонукає до більш уважного огляду. Моделі, оптимізовані лише для точності, можуть непомітно втрачати чутливість без того, щоб це було очевидним з головної цифри.
Що таке Grad-CAM і що воно додає крім оцінки продуктивності?
Це показує, які частини рентгенівського знімка вплинули на рішення моделі, дозволяючи клінікам та розробникам перевірити, чи зосереджується модель дійсно на патології легенів, а не на будь-якому нерелевантному артефакті, який випадково корелював із міткою в навчальному наборі даних.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте the simulation і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію the simulation