Добуток двічі
Все починається з визначення умовного ймовірності: P(A|B) = P(A ∩ B) / P(B). Також спільну ймовірність P(H ∩ E) можна записати двома способами — як P(E|H)·P(H) або як P(H|E)·P(E) — і прирівнявши їх, отримуємо теорему Байєса:
P(H|E) = P(E|H) · P(H) / P(E) H - гіпотеза (те, що вас цікавить) E - доказ (що спостерігається) P(E) = Σᵢ P(E|Hᵢ)·P(Hᵢ) ← нормалізуючий константа Це вся теорема — застосування правила добутку двічі. Її сила повністю залежить від того, на що ми умовляємо: H - гіпотеза (модель, діагноз, ухил монетки), а E - доказ, який ми насправді спостерігали.
P(H|E) = P(E|H) · P(H) / P(E) H = hypothesis (what you care about) E = evidence (what you observed) P(E) = Σᵢ P(E|Hᵢ)·P(Hᵢ) ← normalising constant
Попередній розподіл, правдоподібність, апостеріорний розподіл
Попередній розподіл P(H) – це те, що ви вважали до отримання даних. Правдоподібність P(E|H) – це ймовірність появи спостереження E, якщо гіпотеза H є вірною – те, що передбачає модель. Апостеріорний розподіл P(H|E) – це оновлений розподіл вашої віри, і він стає попереднім для наступного спостереження. Знаменник P(E), маргінальна правдоподібність, однаковий для всіх гіпотез і просто нормалізує апостеріорний розподіл так, щоб його сума дорівнювала 1.
Базавий омани: позитивний результат не є доказом
Хвороба вражає 1% населення. Тест має 99% чутливості та 98% специфічності. При умові позитивного результату, яка ймовірність того, що людина насправді хвора?
P(+) = 0.99×0.01 + 0.02×0.99 = 0.0297 Ймовірність захворювання за умови позитивного результату (P(D|+)) = 0.99×0.01 / 0.0297 ≈ 0.333 → лише 33%! Незважаючи на високу точність тесту, один позитивний результат означає лише 33% ймовірності захворювання, оскільки хвороба рідкісна – низький початковий розподіл (prior) домінує. Проведіть повторний тест і використовуйте 0.33 як новий початковий розподіл: другий позитивний результат підвищує P(D++) приблизно до 96%. Це саме те, в чому полягає суть послідовного оновлення Байєса, і тому ігнорування попереднього розподілу – базава обману – призводить до надмірно впевнених діагнозів.
P(+) = 0.99×0.01 + 0.02×0.99 = 0.0297 P(D|+) = 0.99×0.01 / 0.0297 ≈ 0.333 → only 33%!
Кон'юговані апріори: оновлення без інтегрування
Коли апріорний розподіл та апостеріорний належать до однієї сімейства розподілів, апріорний розподіл називається кон’югованим до ймовірності, і для оновлення не потрібне жодне чисельне інтегрування. Уявіть собі підкидання монети n разів, спостерігаємо k орлів, і якщо апріорна оцінка ухилу θ є Beta(α, β), то апостеріорний розподіл просто дорівнює Beta(α + k, β + n − k). Однорідний апріор (α = β = 1) дає середнє значення апостеріорного як (k+1)/(n+2) – це метод Laplace smoothing. Інші класичні пари: ймовірність Gaussian + апріорний розподіл Gaussian → апостеріорний розподіл Gaussian (лінійний фільтр Кальмана); ймовірність Poisson + апріорний розподіл Gamma → апостеріорний розподіл Gamma; Categorical + Dirichlet → Dirichlet (моделі мов).
Наївний Байєс: prior × likelihood, по одному слову за раз
Спамовий фільтр – це застосування теореми Байєса слово за словом: P(спам|слова) ∝ P(спам) × Π P(слово|спам), припускаючи, що випадки появи слів незалежні один від одного, якщо враховувати клас – "наївне" припущення. За допомогою Laplace smoothing для уникнення нульових ймовірностей невідомих слів, цей простий модель класифікує «безкоштовний запит на виграш грошей» як спам та «перегляд поточної агіти для зустрічі в офісі» як хам, використовуючи лише відношення кількості слів, отриманих з невеликого навчального набору.
Frequently asked questions
Яка різниця між попереднім, ймовірністю та наступним?
Попередній P(H) – це те, що ви вважали про гіпотезу до отримання даних. Ймовірність P(E|H) – це ймовірність спостережуваних доказів, якщо б гіпотеза була правдивою. Наступний P(H|E) – це оновлена ваша віра після комбінування обох за допомогою теореми Бейса – і стає новим попереднім для наступного спостереження.
Чому позитивний медичний тест не означає, що у вас захворювання?
Це помилка на основі частоти (base-rate fallacy). Навіть тест з 99% чутливості та 98% специфічності, застосований до захворювання з 1% поширеністю, дає лише 33% шанс насправді мати захворювання, враховуючи один позитивний результат – оскільки низька попередня ймовірність захворювання домінує в розрахунках. Теорема Бейса робить це явним, де інтуїція часто зазнає невдачі.
Що робить попередній ‘кон’югованим’ до ймовірності?
Попередній є кон’югованим до ймовірності, коли наступний належить до тієї ж сітки розподілів, що і попередній, дозволяючи закриті форми оновлень без чисельної інтеграції. Класичний приклад – Бета попередній з Біноміальною ймовірністю, який завжди дає Бета наступний – просто додайте спостережувані успіхи та невдачі до параметрів попереднього.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте the simulation і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію the simulation