Strona główna▸Artykuły▸Lab z niepewnością CheXpert

Lab z niepewnością CheXpert

Radiolog czytający obraz piersiowy nie zawsze osiąga proste odpowiedzi tak lub nie. Sylwetka serca może być „mildywnie rozszerzona, wykluczenie cardiomegalii niemożliwe”. Tropiec mroczny może być „może reprezentować wcześniejszą koncentrację, zalecana korelacja kliniczna”. Te wątpliwości nie są nieudolnością, a raczej szczerym odbiciem rzeczywistej niepewności diagnostycznej. Gdy badacze stworzyli CheXpert – landmarkowy zestaw danych obrazów piersiowych na skalę wieloskalową wydany przez Stanford w 2019 roku – musiały zdecydować, co zrobić ze tej niepewności podczas budowy zestawu danych, a dokładniej dla ok. 224 000 obrazów. To symulacja pozwala na eksplorację konsekwencji tego wyboru bezpośrednio: ustaw symulowane poziomy pewności dla pięciu rzeczywistych znalezisk CheXpert, przełączaj się między trzy polityki obsługi niepewności porównane w oryginalnym badaniu i obserwuj, jak to samo podstawowe wyjście modelu może być relabellowane, a miara performansu ilustracyjna przesuwa się jedynie ze względu na definicję „niepewności”.

mysimulator teamZaktualizowano — czerwiec 2026≈ 9 min czytania▶ Otwórz symulację

Co to jest CheXpert i z czym właściwie się ono skupia

CheXpert wprowadzony w pracy „CheXpert: A Large Chest Radiograph Dataset with Uncertainty Labels and Expert Comparison” przez Irvin i in., to zestawienie obrazów piersiowych ze Stanford Hospital, przyporządkowane do etykiet dla 14 obserwacji: zjawisk takich jak Cardiomegaly, Edema, Consolidation, Atelectasis, Pleural Effusion, Pneumonia, Pneumothorax i inne, oraz kategorii „Brak Znalezienia”. W kluczowym momencie żadna z tych etykiet nie została przypisana przez radiologa, który manualnie tagowałby każdą obraz. Na takim skalę manualne przypisywanie etykiet lekarzom dla setek tysięcy obrazów jest niemożliwe finansowo, dlatego zespół CheXpert stworzył automatycznego etykietatora – narzędzie opartego na regułach i przetwarzania języka naturalnego, które czyta już istniejący wypis radiologiczny dla każdego badania i wydobywa etykietę dla każdego z 14 zjawisk bezpośrednio z słów wypisu. Etykietator nie wygeneruje tylko pozytywnych ani negatywnych odpowiedzi. Wypisy radiologiczne są pełne niepewnych, hedgingowych fraz ze względu na naturę, takich jak „może reprezentować”, „nie można wykluczyć”, „prawdopodobnie”, „pytanie” i CheXpert etykietator był zrozumiały dla tego hedgingu i wygenerował trzecią kategorię: niepewność. Dla każdego zjawiska na każdym obrazie, etykieta wydobyta z wypisu może być pozytywna, negatywna, niepewna lub prostym faktem, że to zjawisko nie jest wspomniane. Kategoria niepewna jest bezpośrednim odzwierciedleniem na skalę zestawu danych tego samego klinicznego hedgingu, który radiolog by użył wypowiedzielsko, i jest obecna w znaczącej części etykiet dla większości zjawisk, co oznaczało, że zespół CheXpert nie mógł jej pomijać i musiał zaprojektować strategię obsługi tej kategorii.

Trzy sposoby obsługi „Nie jestem pewien”: U-Ones, U-Zeros i U-Ignore

Oryginalna praca CheXpert oceniła kilka podejść do obsługi klasy niepewnych etykiet podczas treningu i walidacji modeli, a ta symulacja skupia się na trzech najintuicyjniejszych z nich. U-Ignore jest najprostszym rozwiązaniem: ignoruje przykłady o niepewnych etykietach dla danego znalezienia, usuwając je z zestawu treningowego dla tego znalezienia i w ocenie wyłączając je z raportowanych metryk. To unika wprowadzania do modelu potencjalnie fałszywej informacji, ale również zyskuje ogromne ilości rzeczywistych danych, co może znacząco zmniejszyć rozmiar używalnego zestawu treningowego w przypadku znalezieniach, dla których niepewność jest powszechna. U-Zeros mapuje każdą niepewną etykietę na negatyw, co efektywnie oznacza, że przyjmując za wygodne założenie do celów treningowych, że radiolog nie mógł zdecydowanie potwierdzić znalezienia, najlepszym podejściem jest „prawdopodobnie nie występuje”. To pozostawia wszystkie przykłady w zestawie danych, ale może systematycznie przeprowadzać nadmierne reprezentację przypadków prawdziwych pozytywnych, gdy korelacja między hedgingiem radiologa a rzeczywistym występowaniem znalezienia jest subtelna, wcześniejsza lub graniczna. U-Ones przyjmuje przeciwny zażycie, mapując każdą niepewną etykietę na pozytywną z powodu rozważania, że autor raportu podniósł możliwość wystąpienia znalezienia w kontekście klinicznym. Ze względu na perspektywę ekranowania, może być bezpieczniejsze dla modelu, aby skierować go do oznaczania potencjalnych znalezień niż ignorowania ich. To zwiększa czułość na subtelne znaleźnienia, ale ryzykuje nauczenie modelu, że niejednoznacznego, niskonfiżbarnego prezentacji powinno być zawsze uznawanych za pozytywne, co może wpłynąć na precyzję. Każde z tych decyzji stanowi inny, dowodzony zakład o to, co „niepewność” najprawdopodobniej oznacza. Centralnym przyczepem doświadczeniowym przerwania CheXpert było pokazanie, że żaden z tych zakładek nie wygrywał bezbłędnie na wszystkich 14 znalezieniach. Najlepsza polityka różniła się w zależności od znalezienia, co jest dokładnie zachowaniem, które symulacja jest zaprojektowana do zrobienia dotykalnym: przesunięcie pewności znalezienia do paska niepewnych oznacza, że „poprawna” klasa rzeczywiście zależy od polityki, którą wybrałeś.

Jak symulacja to reprezentuje

Ten symulator nie uruchamia na prawdziwych danych pikseli rzeczywistego, treningowego sieci konwolucyjnej. Zamiast tego modeluje bezpośrednio dalsze konsekwencje niepewności polityki etykiet: każdy z pięciu przycisków ustawia symulowaną oryginalną ocenę pewności, z zakresu 0 do 1, dla jednego znalezienia, reprezentującego wyjście warstwy wyjściowej rzeczywistej sieci wielokrotnej etykietowania modelu piersiowego na dany obraz. Oceny od 0,40 do 0,60 leżą w symulowanym „pasie niepewności”, reprezentującym prawdziwie niejasne poleścienne miejsce, gdzie pewność modelu odzwierciedla język radiologa pełnym zaskoczeń. Poza tym pasem, klasyfikacja jest stała i polityki zależna: ocena 0,5 lub wyższa oznacza pozytywne, a niższa negatywne, dokładnie jak przy standardowej granicy binarnej. Wewnątrz pasma, polityka wybrana przebywa w dominacji: U-Ones zawsze twierdzi, że jest to pozytywne, U-Zeros zawsze twierdzi, że jest to negatywne, a U-Ignore wyklucza je całkowicie z klasyfikacji diagramu kolumnowego i wskaźnika performansu ilustracyjnego, pokazując jasno odrębny pomarańczowy znacznik „ODWOLANE” zamiast wymuszenia etykiety w jednym lub innym kierunku. Diagram kolumnowy symetrycznie oświetla pas 0,40-0,60 niepewności na wszystkich pięciu znalezieniach jednocześnie, umożliwiając szybkie zrozumienie, które znalezienia obecnie leżą w obszarze niejasnym i mogłyby być wpłynąć na zmianę polityki, a które są już pewne jako pozytywne lub negatywne bez względu na politykę. Symulacja również liczy ilustracyjny wynik AUC-sty, który się przemieszcza w zależności od tego, jakie znalezienia są obecnie niepewne i jaką politykę jest aktywną. Ta liczba jest jasno zdefiniowana jako narzędzie nauczające, a nie reprezentacja konkretnego wyniku referencyjnego CheXpert opublikowanego w rzeczywistym papierze; symulacja etykietuje ją tak. Jej celem jest pokazanie jednym numerem rzeczywistej fakty, że zmiana sposobu obsługi porównawczej małej części etykiet niejasnych może znacząco wpłynąć na zdeklarowaną wydajność modelu.

Dlaczego radiologowie sami się nie zgadzają, i dlaczego to ma znaczenie dla oceny AI

Niepewność etykiet w CheXpert nie jest artefaktem słabo zaprezentowanych raportów; zwraca się do głębszego i dobrze dokumentowanego faktu: radiologowie naprawdę się ze sobą nie zgadzają, a czasem nawet ze sobą na drugim przeczytaniu, gdy interpretują te same obrazek piersiowy. Znajomości takie jak lekka hiperfunkcja serca, wcześniejsza edema intersticialny lub mała akumulacja płynu w płucach mogą się znajdować blisko granicy normalnej zmienności, jakości obrazu, położenia pacjenta i poprzednich badań. Wszystko to wpływa na to, co jest widoczne, a radiałodzy różnią się w swoim szkoleniu i osobistym próg detekcji granicznych znalezisk. To właśnie powoduje, że studium CheXpert nie skończyło się jedynie na automatycznych etykietach; artykuł również zawiera component walidacyjny porównujący wydajność modeli z paneliem radiałodzy uznanymi przez komisję, na zbiorze przeznaczonym do walidacji, jasno przyznając, że prawda podstawowa w radiografii piersiowej nie jest jednym ustalonym faktem, ale coś bliższego rozkładowi ekspertowskiego zdania. Wprowadzenie klasy niepewności do etykiet zbioru danych zamiast nacisku na artfikularne czyste i jasne wyniki pozytywne lub negatywne było świadomym wyborem metodologicznym, aby zachować tę rzeczywistą niejednoznaczność w danych, a nie milczać o nią. Dla każdego oceniającego lub porównującego modele AI do analizy obrazów piersiowych, to ma konkretny praktyczny znaczenie: liczba referencyjna zadeklarowana bez wskazania, jak niepewne etykiety były obsługane, jest niekompletna. Dwa modele treningowe i oceniane z różnymi politykami niepewności nie są porównywane na równych podstawach, nawet jeśli ich liczby AUC w głowce wyglądają podobnie, ponieważ podstawa „poprawności” dla znaczącej części zbioru danych była inna w każdym przypadku.

Dlaczego wielokrotne badanie metod jest właściwym podejściem

Za sprawą tego, że żaden pojedynczy zasieg niepewności nie dominuje w każdym z odnalezionych wyników, decyzja CheXpert zapisu do raportowania wyników pod wieloma metodami obok siebie, a nie wyboru jednej „wygranej” metody i ukrycia pozostałych, jest samodzielnym ważnym przyczynkowaniem metodologicznym, które wpłynęło na sposób, w jaki późniejsze zestawy danych i artykuły medyczno-obrazowe raportują niepewność. Odmawia ono temu, aby wybierać metodę, która produkuje najbardziej błyskotliwe dane do prezentacji dla jednego z odnalezionych wyników, a zamiast tego daje czytelnikom informacje potrzebne do oceny, czy moc zaprezentowana przez model jest ogólne, czy to artefakt jednej konkretnej wyboru etykiet. To najważniejsze dla odnalezionych wyników, gdzie lekko złożona prezentacja i jasna prezentacja są klinicznie bardzo różne w urgencji, małe naczyne pliczkowe, wcześniejsza edema intersticialny i mniej stopnia cardiomegali między nimi, gdzie „niepewny” zasięg nie jest rzadkim przypadkiem brzegowym, ale znacznie ważniejszą częścią rzeczywistych przypadków. Model oraz badacze, którzy tylko stawiają wydajność pod metodą, która okazuje się wyglądać najlepiej, przedstawiają niekompletne i potencjalnie fałszywe obraz tego, jak ten model zachowuje się na pełnym spektrum rzeczywistych, niejasnych obrazów piersiowych, które spotka go w praktyce.

Uwaga co do tego, czym jest i czym nie jest to narzędzie

To edukacyjna, ilustratywna symulacja, a nie narzędzie diagnostyczne ani porada lekarska. Nie analizuje rzeczywistych obrazów piersiowych, nie uruchamia rzeczywistej sieci neuronowej uczonej, a jej podobnego do AUC miary jest uproszczonym narzędziem nauczania zamiast potwierdzonych klinicznych warstw wydajności. Rzeczywiste modele AI dotyczące obrazów piersiowych, w tym te pochodne od CheXpert, są rozwojane i oceniane do celów badawczych pod strictym podejściem metodologicznym, a nawet wtedy nie mogą zastąpić interpretacji kwalifikowanego lekarza radiologa. Jeśli masz rzeczywisty obraz piersiowy lub problem zdrowotny, prosimy o skonsultowanie się z uprawniającym do praktyki lekarzem, a nie na podstawie tej symulacji ani żadnej innej modelu badawczego AI dla interpretacji ani diagnostyki.

Często zadawane pytania

Czym jest CheXpert i dlaczego używa niepewnych etykiet?

CheXpert to duży zestaw obrazów radiologicznych piersi wydany przez badaczy z Stanfordu (Irvin et al., 2019), zawierający ponad 200 000 zdjęć, z etykietami dla 14 najpopularniejszych objawów wydobywanych automatycznie ze zrzutów radiologicznych w formie tekstowej towarzyszących każdemu obrazowi przy użyciu rule-basa labelera procesu przetwarzania języka naturalnego. Ponieważ lekarze radcyjni regularnie zagwarantowują swoje oceny pisemne używając zdań typu „nie można wykluczyć” lub „może być mała naczynek”, labeler nie jest w stanie zawsze rozstrzygnąć objawu jako jasno pozytywny czy negatywny, dlatego również wydaje się jasne etykietę niepewną, gdy język zrzutów jest niejasny.

Czym są U-Ones, U-Zeros i U-Ignore?

To trzy z polityk obsługiwania etykiet porównanych w pracy CheXpert podczas treningu i oceny modeli na niepewnych etykietach. U-Ones przypisuje każdemu etykiecie niepewnej wartość pozytywną, U-Zeros przypisuje każdej etykiecie niepewnej wartość negatywną, a U-Ignore całkowicie odrzucany jest przykład z etykietą niepewną dla danego objawu, tak że model ani się na nim nie uczy, ani go nie ocenia. Oryginalna studia wykazały, że żadna z polityk nie była najlepsza dla wszystkich 14 objawów, co jest powodem do tego, że wyniki CheXpert są zwykle przedstawiane w zależności od objawu i polityki, a nie jako jedno ogólne liczba.

Dlaczego lekarze radcyjni zgadzają się o tym samym obrazie piersiowym?

Interpretacja obrazów radiologicznych piersiowa obejmuje rzeczywistą zmiennistość perceptualną i ocenową: niepewne objawy, takie jak wcześniejsza edema pulmonalny lub lekko rozszerzona sylwetka serca, mogą być bliskie normalnej granicy, jakość obrazu i położenie pacjenta wpływają na to, co jest widoczne, a lekarze radcyjni różnią się w treningu i próg dla oznaczania objawów brzegowych. Studia pokazujące zgodność między lekarzami radcyjnimi dotyczących obrazów radiologicznych piersiowych wykazują zmiennistość even wśród doświadczonego czytelnika, co jest dokładnie tym rodzajem niepewności rzeczywistego świata, który etykiety niepewne w zestawie danych jak CheXpert mają na celu odzwierciedlić, a nie ukryć.

Czy wyższa ilustracyjna AUC w tym symulatorze oznacza, że polityka jest obiektywnie lepsza?

Nie. Liczba podobna do AUC w tym symulatorze to uproszczone, ilustracyjne zastępcze rozwiązanie oparte na ustalonej białości przykładów, zaprojektowane tylko do pokazania, że wybór polityki zmienia wydane wyniki w rzeczywistym i niebanalnym sposób, a nie do powtórzenia czy rangowania rzeczywistych wyników referencyjnych CheXpert. W rzeczywistym badaniu najlepsza polityka była zależna od objawu i wyznaczana empirycznie na podstawie walidacji wobec prawdy zgodności etykietowanych przez lekarzy radcyjnich, a nie jednym uniwersalnym przepisem.

Czy ten symulator lub modele typu CheXpert mogą diagnozować rzeczywisty obraz piersiowy?

Nie. To edukacyjny symulator, który nie wykonuje na danych rzeczywistych obrazów modelu, a modele badawcze typu CheXpert, nawet gdy wykazują dobre wyniki w referencyjnych kryteriach, nie są zatwierdzonym urządzeniem diagnostycznym i nie mogą być subsztancją oceny przez kwalifikowanego lekarza radcyjnego lub lekarza. Ktoś mając rzeczywisty obraz piersiowy lub zdrowotny problem powinien skonsultować się z uprawniającym się specjalistą zdrowotnym, a nie polegać na tym narzędzie ani jakimkolwiek modelu AI badawczego na diagnostykę.

▶ Wypróbuj na żywo

Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz CheXpert Uncertainty Lab i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.

▶ Otwórz symulację CheXpert Uncertainty Lab

Co znalazłeś?

Dodaj kroki odtworzenia (opcjonalnie)