Головна▸Статті▸Лабораторія невизначеності CheXpert

Лабораторія невизначеності CheXpert

Радіолог, який читає рентгенівський знімок грудної клітки, не завжди дає чіткі відповіді «так» або «ні». Серцевий очерк може бути «слабо збільшений, не виключається кардіомегалія». Хмарне утворення може бути «можливо представляє ранню консолідацію, рекомендовано клінічне обстеження». Ці застереження не є безглуздістю, вони є чесним відображенням справжньої діагностичної невизначеності, і коли дослідники створили CheXpert, знакові великі масові рентгенівські знімки грудної клітки, опубліковані Стэнфордським університетом у 2019 році, вони вирішили, що робити з цією невизначеністю на рівні набору даних, охоплюючи приблизно 224 000 зображень. Ця симуляція дозволяє вам дослідити наслідки цього рішення безпосередньо: встановіть симульовану оцінку впевненості для п’яти реальних результатів CheXpert, перемикайтеся між трьома політиками обробки невизначеності, які порівнювалися у вихідному дослідженні, і спостерігайте, як одна й та сама основна модель може бути перемітка, і як репрезентативна метрика продуктивності змінюється лише через те, як «невизначеність» визначається.

mysimulator teamОновлено — червень 2026≈ 9 хв читання▶ Відкрити симуляцію

Що таке CheXpert і звідки беруться його мітки

CheXpert, представлений у праці "CheXpert: A Large Chest Radiograph Dataset with Uncertainty Labels and Expert Comparison" від Irvin et al., є набором рентгенівських знімків грудної клітини, зібраним з Університетської лікарні Стэнфорда, узятих у парі з мітками для 14 спостережень: такі як кардіомегалія, застій, консолідація, стеноз легень, плевральна випітка, пневмонія, плевральний коллапс та інші, а також категорія «Без знайдених змін». Важливо зазначити, що жодна з цих міток не була присвоєна радіологом, який вручну позначав кожне зображення. На такому рівні ручне маркування лікарями сотень тисяч зображень є надмірно дорогим, тому команда CheXpert побудувала автоматичний інструмент маркування – систему на основі правил обробки природної мови, яка читає вільний текст з радіологічного звіту, написаного для кожного дослідження, та витягує мітку для кожного з 14 знайдених змін безпосередньо з формулювання звіту. Ця система не просто видає позитивні чи негативні результати. Радіологічні звіти за своєю природою сповнені невизначених, обережних формулювань, таких як «може вказувати на», «не може виключити», «ймовірно», «запитання» тощо. Інструмент маркування CheXpert був спеціально розроблений для розпізнавання цих невизначеностей і видає третю категорію: невизначене. Таким чином, для будь-якого знайденого у зображенні стану мітка, витягнута зі звіту, може бути позитивною, негативною, невизначеною або взагалі не згадана. Ця категорія «невизначеності» є безпосереднім відображенням клінічної обережності радіолога, яка використовується вголос, і вона присутня у значній кількості міток для більшості знайдених змін, що означало, що команді CheXpert не можна було просто ігнорувати її та довелося розробити стратегію для її обробки.

Три способи обробки «Я не впевнений»: U-Одиниці, U-Нулі та U-Ігнорування

Оригінальне дослідження CheXpert оцінювало кілька підходів до того, як діяти з класом невизначених міток при навчанні та валідації моделей, і ця симуляція зосереджена на трьох найбільш інтуїтивно зрозумілих з них. U-Ігнорування є найпростішим: вважайте приклади з невизначеними мітками для певного висновку ніби вони взагалі не позначені, відкидаючи їх із навчального набору цього висновку та, при оцінці, виключаючи їх із повідомленої метрики. Це запобігає введенню потенційно неправильної інформації в модель, але також викидає значний обсяг даних, і для висновків, де невизначеність є поширеною, це може суттєво зменшити доступний навчальний набір. U-Нулі замість цього відображають кожну невизначену мітку на від’ємне значення, ефективно припускаючи, що коли радіолог не зміг впевнено підтвердити висновок, найбезпечніше робоче припущення для навчальних цілей – «ймовірно, відсутній». Це зберігає кожен приклад у наборі даних, але може системно недооцінювати справжні позитивні випадки, коли обережність радіолога корелює з тим, що висновок насправді присутній у тонкій, ранній або межи-формі. U-Одиниці роблять протилежне припущення, відображаючи кожну невизначену мітку на позитивне значення, спираючись на те, що автор звіту підняв можливість висновку з клінічних причин, і з точки зору скринінгу може бути безпечніше, щоб модель схилялася до позначення можливого висновку, ніж відкидати його. Це може підвищити чутливість до тонких висновків, але ризикує навчити модель, що неоднозначні, низькодовірчі презентації завжди повинні бути позначені як позитивні, що може погіршити точність. Кожен з цих виборів робить різний, обґрунтований крок щодо того, що «невизначено» найімовірніше означає, і центральний емпіричний внесок дослідження CheXpert тут полягав у тому, що жодна з цих стратегій не перемагала послідовно для всіх 14 висновків. Найкраща політика варіювалася від висновку до висновку, що й є поведінкою, яку ця симуляція побудована для зробити відчутною: перемістіть впевненість висновку у зону невизначеності та «правильне» класифікування справді залежить від того, яку політику ви обрали.

Як симуляція моделює це

Цей симулятор не запускає справжню навчену згорткову мережу на реальних піксельних даних, що потребувало б живого моделі та реальних зображень. Замість цього він моделює наслідок політики з позначкою невизначеності: кожен із п’яти слайдерів встановлює симуляційний свіжий рівень впевненості від 0 до 1 для одного висновку, що представляє собою те, що може видати шар вихідних даних багатоміткової грудної рентгенівської моделі справжнього мультиміткового рентгенологічного зображення для цього висновку на даному зображенні. Оцінки від 0,40 до 0,60 потрапляють у симуляційну «ділянку невизначеності», яка представляє собою справді неоднозначну середню точку, де впевненість моделі відображає власну обережність рентгенолога. За межами цієї зони класифікація є фіксованою та незалежною від політики: оцінка 0,5 або вище є позитивною, нижче — негативною, точно так само як і з будь-яким стандартним бінарним порогом. Всередині зони політика бере владу: U-Ones завжди називає її позитивною, U-Zeros завжди називає її негативною, U-Ignore виключає її з діаграми класифікації та з описової метрики продуктивності повністю, позначеної окремим жовтим маркером «ВИКЛЮЧЕНО» замість того, щоб примусово призначати їй мітку будь-яким чином. Затінена область діаграми на основі барів візуально позначає цю ділянку невизначеності 0,40–0,60 для всіх п’яти висновків одночасно, щоб ви могли за мить побачити, які висновки зараз сидять в неоднозначній зоні та насправді вплинуть на зміну політики, на відміну від тих, що з упевненістю позитивні або негативні незалежно від політики. Симуляція також обчислює ілюстративний показник AUC-стилю, який змінюється залежно від того, які висновки зараз невизначені та яка політика активна, побудований на невеликих фіксованих коригуваннях на основі знаходження для кожного висновку, для кожної політики, що надихаються реальним папером про те, що різні політики допомагають або шкодять різним висновкам. Це число явно є навчальною дошкою, а не відтворення будь-якого конкретного бенчмарку CheXpert, і симуляція позначає це; його мета — зробити видимим у одній цифрі той факт, що зміна того, як ви обробляєте порівняно невеликий шматочок неоднозначних міток, може змістити заявлену продуктивність моделі на значний рівень.

Чому радіологи не завжди погоджуються, і чому це важливо

Невизначеність маркування в CheXpert не є наслідком погано складених звітів, вона виникає через глибке та добре задокументоване явище: справді радіологи не завжди погоджуються між собою або з самим собою при повторному перегляді одного рентгенівського знімка грудної клітки. Такі результати, як легка кардіоміопатія, раннє інтерстиційне набряклість або невелика плевральна ексудація, можуть знаходитися поблизу межі нормальної варіації, якості зображення, положення пацієнта, статуру тіла та попередніх знімків для порівняння, і індивідуальні радіологи відрізняються навчальним досвідом, базою знань та особистим порогом для виявлення підозрілих знахідок.

Чому багатополісна оцінка є правильною підходом

Враховуючи той факт, що жодна окрема політика невизначеності не домінує у всіх висновках, рішення статті CheXpert щодо звітування результатами за кількома політиками одночасно, а не вибір «переможного» підходу та приховування інших, є важливим методологічним внеском, який вплинув на те, як пізніше звітні дані про медичні зображення та статті повідомляють про невизначеність. Це усуває спокусу обрати політику, яка дає найприємнішу числову оцінку для окремого висновку, і надає читачам інформацію, необхідну для визначення, чи загалізеться звітний рівень міцності моделі або це артефакт конкретного вибору маркування. Це особливо важливо для висновків, де тонке представлення та чітке представлення клінічно дуже відрізняються за терміновістю, зокрема, невеликі плевральні випиття, раннє інтерстиційне набряк і легка кардіомегалія серед них, де «зона невизначеності» – це значний обсяг випадків у реальному світі, а не рідкісний крайній випадок. Модель та дослідники, які її звітують, що завжди повідомляють про продуктивність за політикою, яка виглядає найкраще, представляють неповне і потенційно оманливе зображення того, як ця модель поводиться на повномірному спектрі реальних, неоднозначних рентгенівських знімків грудної клітки, які вона зустрічатиме в практиці.

Примітка щодо того, чим є цей інструмент, і чим він не є

Це освітнє, ілюстративне моделювання, а не діагностичний інструмент та не медийна порада. Воно не аналізує реальні рентгенівські знімки, не запускає справжню навчену нейронну мережу, а його показник AUC є спрощеним навчальним приладом, а не валідованим клінічним показником продуктивності. Дослідження штучного інтелекту для грудної рентгенівської зйомки, включаючи моделі, похідні від CheXpert, розробляються та оцінюються в дослідницьких цілях за допомогою ретельної методології, і навіть тоді це не замінює інтерпретацію кваліфікованим радіологом. Якщо ви або хтось із ваших знайомих має справжній рентген грудної клітки або проблеми зі здоров’ям, будь ласка, зверніться до ліцензованого медичного працівника, а не покладайтеся на це моделювання або будь-яку дослідницьку модель штучного інтелекту для інтерпретації чи діагностики.

Часті запитання

Що таке CheXpert і чому він використовує непевні мітки?

CheXpert — це великий набір даних із рентгенівських знімків грудної клітини, опублікований дослідниками Стэнфордського університету (Irvin et al., 2019), що містить понад 200 тисяч зображень з мітками для 14 поширених виявлень, отриманих автоматично з безкоштовного тексту медичних звітів рентгенологів, які супроводжували кожен знімки, за допомогою системи обробки природної мови на основі правил. Оскільки радіологи здебільшого використовують невизначені формулювання у своїх записах, такі як «не можна виключити» або «можлива невелика рідина в плевральній оболонці», система не завжди може чітко визначити виявлення як позитивне чи негативне, тому видає явну непевну мітку, коли мова звіту неоднозначна.

Що таке U-Ones, U-Zeros і U-Ignore?

Це три політики обробки міток, які порівнювалися в дослідницькій роботі з CheXpert для навчання та оцінки моделей з непевними мітками. U-Ones відображає кожну непевну мітку на позитивну, U-Zeros відображає кожну непевну мітку на негативну, а U-Ignore просто видаляє приклади з непевними мітками з навчального та оціночного наборів для цього виявлення повністю, тому модель нічого не вчиться з них і не оцінюється за їх допомогою.

Чому радіологи не погоджуються щодо одного й того ж рентгену грудної клітини?

Інтерпретація рентгенівських знімків грудної клітини включає справжню варіабельність сприйняття та судження: тонкі виявлення, такі як раннє набряк легень або незначно збільшена серцева тінь, можуть знаходитися поблизу норми, якість зображення та положення пацієнта впливають на те, що видно, і радіологи відрізняються у навчанні та встановленні порогів для виявлення підозрілих випадків. Дослідження згоди між радіологами щодо рентгенівських знімків грудної клітини постійно показують вимірювані показники розбіжностей навіть серед досвідчених читачів, що є саме тим типом реальної неоднозначності, яку непевні мітки в наборі даних, такому як CheXpert, призначені для захоплення, а не маскувати.

Чи означає вищий AUC-індекс у цьому симуляторі, що політика обробки міток є об'єктивно кращою?

Ні. Числовий показник AUC у цьому симуляторі — це спрощений, ілюстративний засіб, побудований на основі фіксованих упереджень, призначений лише для того, щоб показати, що вибір політики впливає на звітні результати таким реальним, нетривіальним способом, а не для відтворення або ранжування фактичних опублікованих результатів бенчмаркінгу CheXpert. У справжньому дослідженні найкраща політика варіювалася залежно від виявлення та визначалася емпірично шляхом валідації проти радіологами позначених істинних даних, а не за допомогою єдиного універсального правила.

Чи може цей симулятор або моделі на основі CheXpert поставити діагноз справжньому рентгену грудної клітини?

Ні. Це освітній симулятор, який не запускає навчену модель на реальних зображеннях, а моделі на основі CheXpert, навіть коли вони добре працюють за показниками бенчмаркінгу, не є схваленими діагностичними пристроями і не є заміною оцінці кваліфікованим радіологами або лікарями. Будь-хто з справжнім рентгенівським знімком грудної клітини чи будь-якими проблемами зі здоров’ям повинен консультуватися із ліцензованим медичним працівником, а не покладатися на цей інструмент або будь-яку штучний інтелект, що базується на дослідженнях, для діагностики.

Спробуйте наживо

Усе, що вище, працює прямо у вашому браузері — відкрийте CheXpert Uncertainty Lab і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.

▶ Відкрити симуляцію CheXpert Uncertainty Lab

Що ви знайшли?

Додати кроки відтворення (опційно)