Головна▸Статті▸Медицина

Теорія Байєса та парадокс медичного тестування

Чому високоточний медичний тест все ще може бути неправильним частіше, ніж правильно, коли захворювання, яке він виявляє, рідкісне, розглянуто крок за кроком з використанням теорії Байєса.

mysimulator teamОновлено — червень 2026≈ 5 хв читання▶ Відкрити симуляцію

Теорія Бейса, викладена та обчислена

Теорія Бейса є безпосереднім алгебраїчним наслідком визначення умовного ймовірності, але її наслідки настільки неінтуїтивні, що заслуговує на окреме ретельне вивчення. Починаючи з правила множення, P(A ∩ B) можна записати двома еквівалентними способами: P(A | B)P(B) та P(B | A)P(A). Прирівнявши їх і поділивши обидва члени на P(B), отримуємо

P(A | B) = P(B | A) · P(A) / P(B)

Іншими словами: ймовірність А за умови, що Б відбулася, дорівнює ймовірності Б за умови А, помноженій на попередню ймовірність А, поділеній на загальну ймовірність Б. Три названі величини в цій формулі – це попередня P(A), правдоподібність P(B | A) та апостеріорна P(A | B); дільник P(B) зазвичай називають доказом або маргінальною ймовірністю, і його завдання полягає лише в тому, щоб масштабувати чисельник так, щоб отримані апостеріорні ймовірності були правильно нормалізовані для всіх можливих значень А.

Розгляд класичного прикладу медичного тестування

Припустимо, що захворювання вражає 1% населення (його поширеність, P(Хвороба) = 0.01). Тест скринінгу має чутливість 90% — тобто правильно повертає позитивний результат для 90% людей, які дійсно мають хворобу, тому P(Позитивний | Хвороба) = 0.90, і специфічність 95%, що означає, що він правильно повертає негативний результат для 95% здорових людей, тобто P(Негативний | Без хвороби) = 0.95, еквівалентно P(Позитивний | Без хвороби) = 0.05, показник хибнопозитивних результатів.

Пацієнт отримує позитивний результат. Яка ймовірність того, що він дійсно має цю хворобу? Спочатку обчислюємо загальну ймовірність отримання позитивного результату в усій популяції, використовуючи закон повного віроядності: P(Позитивний) = P(Позитивний | Хвороба)P(Хвороба) + P(Позитивний | Без хвороби)P(Без хвороби) = (0.90 × 0.01) + (0.05 × 0.99) = 0.009 + 0.0495 = 0.0585. Потім застосовуємо теорему Байєса: P(Хвороба | Позитивний) = (0.90 × 0.01) / 0.0585 = 0.009 / 0.0585 ≈ 0.154, або приблизно 15.4%.

Незважаючи на те, щоб тест здавався дуже точним в обох аспектах, позитивний результат лише підвищує ймовірність захворювання з початкової 1% до приблизно 15% після, що не є переконанням. Інтуїтивна помилка, яку роблять більшість людей, полягає у ментальному підстановці чутливості (90%) для відповіді, по суті, плутаючи P(Позитивний | Хвороба) з абсолютно різною величиною P(Хвороба | Позитивний).

Чому рідкість домінує в арифметиці

Причина повністю полягає у базових показниках. З 10 000 людей у цьому населенні близько 100 справді мають хворобу, і тест правильно виявляє приблизно 90 з них. Але серед 9 900 здорових людей рівень хибних позитивних результатів 5% все ще генерує близько 495 хибних тривог. Багатоток позитивних результатів (90 + 495 = 585 осіб) домінує завдяки хибним позитивним результатам з набагато більшої здорової популяції, незважаючи на те, що кожен окремий здоровий людина мала лише невеликий шанс 5% на хибний тривог. Цей підхід «підрахунок населення», який іноді називають природним міркуванням частості — часто є більш інтуїтивним для людей, ніж пряме обчислення за формулою теореми Байєса, але дає абсолютно той самий числовий результат: 90 позитивних з 585 позитивних є справжніми позитивними результатами, що становить 90/585 ≈ 0.154, що точно відповідає формулі.

Попередня ймовірність та оновлення з урахуванням нової інформації

Теорема Бейса не зупиняється після одного оновлення. Якщо того ж пацієнта перевіряють повторним незалежним тестом, отриманий післяодинове значення (15,4%) стає попередньою ймовірністю для інтерпретації другого результату, і обчислення повторюються. Це послідовне оновлення є основною ідеєю байєсівської статистики: замість того, щоб розглядати ймовірність як єдичне значення для оцінки та зафіксованого, її розглядають як віру, яка систематично коригується зі збільшенням кількості незалежних доказів, сходячись до істини з накопиченням незалежних даних.

У більш загальному байєсівському статистичному моделюванні попередня ймовірність не є лише одним числом, наприклад, поширенням захворювань, а цілою ймовірністю щодо параметра — наприклад, діапазон правдоподібних значень для справної ефективності лікарського засобу до початку клінічних випробувань, часто представлений розподілом Бета, коли параметр є ймовірністю між 0 і 1. Об'єднання цієї попередньої ймовірності з ймовірністю спостережуваних даних, знову ж таки, за допомогою теореми Бейса, дає повну післяодинову ймовірність щодо параметра, яка не лише відображає найкращу оцінку, але й залишається невизначеність навколо неї, таким математично узгодженим способом, який класичне тестування гіпотез не надає природно.

За межами медицини: одна й та ж сама логіка в фінансах і не лише

В точності така сама структура повторюється будь-де, де використовується сигнал із неточною інформацією для виявлення рідкого основного стану. Алгоритм виявлення шахрайства, який сигналізує про транзакцію, модель кредитування, яка сигналізує про ризик неповернення кредиту, фільтр спаму, який сигналізує про електронний лист, або система безпеки аеропорту, яка сигналізує про пасажира – всі вони стикаються з однаковими математичними задачами: якщо виявлюване основне подія рідкісне, навіть високоточний детектор видаватиме значну кількість хибних спрацьовувань відносно справжніх виявлень, і правдоподібність апостеріорна того, що позначений випадок є реальним, повинна бути обчислена з урахуванням базової ймовірності в основному, а не читатися безпосередньо з рекламованої точності детектора. Саме тому, на практиці, байєсівське міркування є стандартним у таких галузях, як клінічна діагностика, кількісна фінансова оцінка ризиків та оцінювання класифікаторів машинного навчання, де будь-які рішення залежать від ймовірностей рідкісних подій.

Часті запитання

Чи означає негативний результат тесту, що пацієнт напевно не має хвороби?

Ні, хоча це близький випадок. Використовуючи ті ж самі числа, P(Відсутність Хвороби | Негативний) можна обчислювати так само: P(Негативний) = (0,10 × 0,01) + (0,95 × 0,99) = 0,001 + 0,9405 = 0,9415, і P(Хвороба | Негативний) = (0,10 × 0,01)/0,9415 ≈ 0,00106, приблизно 0,1%. Отже, негативний результат заспокоює та правильно знижує ймовірність хвороби значно нижче 1% попередньої, але це не абсолютна впевненість.

Що станеться з апостеріорним розподілом, якщо хвороба буде більш поширена, скажімо, на 20%, а не на 1%?

Використовуючи ті ж самі чутливість та специфічність: P(Позитивний) = (0,90 × 0,20) + (0,05 × 0,80) = 0,18 + 0,04 = 0,22, тому P(Хвороба | Позитивний) = 0,18/0,22 ≈ 0,818, приблизно 82%. Той самий тест стає набагато більш надійним просто через те, що хвороба є більш поширеною серед перевіреного населення – той самий тест, радикально інша реальна надійність, виключно як функція попередньої.

Чому лікарі іноді замовляють другий, відмінний тест після позитивного скринінгового результату?

Бо послідовне оновлення Бейєса множиться експоненціально. Підтверджуючий тест, особливо якщо він має інший, переважно незалежний джерело помилок порівняно з першим, різко підвищує апостеріорну ймовірність, що є точною причиною того, що багато програм скринінгу використовують дешевий, високочутливий початковий тест, за яким слідує дорожчий, високоспецифічний підтверджуючий тест, замість того, щоб покладатися лише на один тест.

Чи є байєсівська статистика протилежною традиційній ('частотної') статистиці?

Це два різні фреймворки, побудовані на одних і тих самих аксіомах Колмогорова, а не суперечливе математичне вчення. Частотні методи розглядають параметри як фіксовані невідомі константи та ймовірність як довгострокову частоту; байєсівські методи розглядають параметри як маючи ймовірнісний розподіл, що відображає невизначеність, оновлюваний за допомогою теореми Бейса зі збільшенням даних. У практиці, при великій кількості даних та відповідному неінформативному поточному розподілі, обидва підходи зазвичай збігаються до дуже подібних числових висновків.

Спробуйте наживо

Усе, що вище, працює прямо у вашому браузері — відкрийте the simulation і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.

▶ Відкрити симуляцію the simulation

Що ви знайшли?

Додати кроки відтворення (опційно)