ГоловнаСтаттіСтатистика

Угоди Байєса: Попередній, Ймовірність та Після

Написано у 1763 році священником Томасом Баєм, ця теорема точно показує, як оновлювати віру при появі нових доказів — і вона все ще фільтрує спам, діагностує хвороби та використовується в машинному навчанні сьогодні.

mysimulator teamОновлено — червень 2026≈ 8 хв читання▶ Відкрити симуляцію

Добуток двічі

Все починається з визначення умовного ймовірності: P(A|B) = P(A ∩ B) / P(B). Також спільну ймовірність P(H ∩ E) можна записати двома способами — як P(E|H)·P(H) або як P(H|E)·P(E) — і прирівнявши їх, отримуємо теорему Байєса:

P(H|E) = P(E|H) · P(H) / P(E) H - гіпотеза (те, що вас цікавить) E - доказ (що спостерігається) P(E) = Σᵢ P(E|Hᵢ)·P(Hᵢ) ← нормалізуючий константа Це вся теорема — застосування правила добутку двічі. Її сила повністю залежить від того, на що ми умовляємо: H - гіпотеза (модель, діагноз, ухил монетки), а E - доказ, який ми насправді спостерігали.

P(H|E) = P(E|H) · P(H) / P(E)

H = hypothesis (what you care about)
E = evidence (what you observed)
P(E) = Σᵢ P(E|Hᵢ)·P(Hᵢ)   ← normalising constant

Попередній розподіл, правдоподібність, апостеріорний розподіл

Попередній розподіл P(H) – це те, що ви вважали до отримання даних. Правдоподібність P(E|H) – це ймовірність появи спостереження E, якщо гіпотеза H є вірною – те, що передбачає модель. Апостеріорний розподіл P(H|E) – це оновлений розподіл вашої віри, і він стає попереднім для наступного спостереження. Знаменник P(E), маргінальна правдоподібність, однаковий для всіх гіпотез і просто нормалізує апостеріорний розподіл так, щоб його сума дорівнювала 1.

жива демонстрація · пов'язана симуляція● LIVE

Базавий омани: позитивний результат не є доказом

Хвороба вражає 1% населення. Тест має 99% чутливості та 98% специфічності. При умові позитивного результату, яка ймовірність того, що людина насправді хвора?

P(+) = 0.99×0.01 + 0.02×0.99 = 0.0297 Ймовірність захворювання за умови позитивного результату (P(D|+)) = 0.99×0.01 / 0.0297 ≈ 0.333 → лише 33%! Незважаючи на високу точність тесту, один позитивний результат означає лише 33% ймовірності захворювання, оскільки хвороба рідкісна – низький початковий розподіл (prior) домінує. Проведіть повторний тест і використовуйте 0.33 як новий початковий розподіл: другий позитивний результат підвищує P(D++) приблизно до 96%. Це саме те, в чому полягає суть послідовного оновлення Байєса, і тому ігнорування попереднього розподілу – базава обману – призводить до надмірно впевнених діагнозів.

P(+) = 0.99×0.01 + 0.02×0.99 = 0.0297
P(D|+) = 0.99×0.01 / 0.0297 ≈ 0.333  → only 33%!

Кон'юговані апріори: оновлення без інтегрування

Коли апріорний розподіл та апостеріорний належать до однієї сімейства розподілів, апріорний розподіл називається кон’югованим до ймовірності, і для оновлення не потрібне жодне чисельне інтегрування. Уявіть собі підкидання монети n разів, спостерігаємо k орлів, і якщо апріорна оцінка ухилу θ є Beta(α, β), то апостеріорний розподіл просто дорівнює Beta(α + k, β + n − k). Однорідний апріор (α = β = 1) дає середнє значення апостеріорного як (k+1)/(n+2) – це метод Laplace smoothing. Інші класичні пари: ймовірність Gaussian + апріорний розподіл Gaussian → апостеріорний розподіл Gaussian (лінійний фільтр Кальмана); ймовірність Poisson + апріорний розподіл Gamma → апостеріорний розподіл Gamma; Categorical + Dirichlet → Dirichlet (моделі мов).

Наївний Байєс: prior × likelihood, по одному слову за раз

Спамовий фільтр – це застосування теореми Байєса слово за словом: P(спам|слова) ∝ P(спам) × Π P(слово|спам), припускаючи, що випадки появи слів незалежні один від одного, якщо враховувати клас – "наївне" припущення. За допомогою Laplace smoothing для уникнення нульових ймовірностей невідомих слів, цей простий модель класифікує «безкоштовний запит на виграш грошей» як спам та «перегляд поточної агіти для зустрічі в офісі» як хам, використовуючи лише відношення кількості слів, отриманих з невеликого навчального набору.

Frequently asked questions

Яка різниця між попереднім, ймовірністю та наступним?

Попередній P(H) – це те, що ви вважали про гіпотезу до отримання даних. Ймовірність P(E|H) – це ймовірність спостережуваних доказів, якщо б гіпотеза була правдивою. Наступний P(H|E) – це оновлена ваша віра після комбінування обох за допомогою теореми Бейса – і стає новим попереднім для наступного спостереження.

Чому позитивний медичний тест не означає, що у вас захворювання?

Це помилка на основі частоти (base-rate fallacy). Навіть тест з 99% чутливості та 98% специфічності, застосований до захворювання з 1% поширеністю, дає лише 33% шанс насправді мати захворювання, враховуючи один позитивний результат – оскільки низька попередня ймовірність захворювання домінує в розрахунках. Теорема Бейса робить це явним, де інтуїція часто зазнає невдачі.

Що робить попередній ‘кон’югованим’ до ймовірності?

Попередній є кон’югованим до ймовірності, коли наступний належить до тієї ж сітки розподілів, що і попередній, дозволяючи закриті форми оновлень без чисельної інтеграції. Класичний приклад – Бета попередній з Біноміальною ймовірністю, який завжди дає Бета наступний – просто додайте спостережувані успіхи та невдачі до параметрів попереднього.

Спробуйте наживо

Усе, що вище, працює прямо у вашому браузері — відкрийте the simulation і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.

▶ Відкрити симуляцію the simulation

Що ви знайшли?

Додати кроки відтворення (опційно)