Баєсове оновлення
Апріорний → Правдоподібність → Апостеріорний — спряжена Beta-Binomial модель
Що демонструє
Теорема Баєса пояснює, як оновлювати переконання при появі нових даних. Для монети з невідомим зміщенням p, Beta розподіл Beta(α, β) є природним апріорним — він живе на [0, 1] та кодує псевдорахунки (О, Р) результатів. Після спостереження k орлів у n підкиданнях, спряжене оновлення точне:
Апріорний Beta(α, β) + k орлів, n−k решок → Апостеріорний Beta(α+k, β+n−k)
Як використовувати
- α, β: α = β = 1 — рівномірний (Uniform) апріорний. α = β = 0.5 — Джеффрі. Велике α (α ≫ β) — оптимістичний апріорний.
- Справжнє p: реальне зміщення монети. Баєсіанець не бачить його безпосередньо — лише результати підкидань.
- Натискайте Підкинути X або вмикайте Авто для накопичення даних.
- Спостерігайте, як апостеріорний розподіл звужується та центрується на справжньому p.
Чи знали ви?
Баєсове оновлення лежить в основі спам-фільтрів, медичної діагностики (PPV проти NPV), GPS-приймачів та сучасного машинного навчання. 95% довірчий інтервал тут має чітку інтерпретацію: «З ймовірністю 95% (з урахуванням даних і апріорного) p лежить у цьому діапазоні» — на відміну від частотного довірчого інтервалу, що тримає параметр фіксованим та варіює гіпотетичні вибірки.
Про Баєсове Оновлення
Ця симуляція моделює спряжене оновлення Beta-Binomial — математичний двигун баєсівського висновку для оцінки частки. Ви починаєте з апріорного переконання щодо зміщення монети, закодованого як розподіл Beta(α, β), а потім багаторазово підкидаєте монету; кожне спостереження перетворює апріорний розподіл на вужчий апостеріорний за точним правилом Beta(α + k, β + n − k), де k — кількість орлів, а n — загальна кількість підкидань. У міру накопичення доказів апостеріорний розподіл звужується й сходиться до справжнього прихованого зміщення p, яке ви задали повзунком.
Баєсове оновлення лежить в основі реальних систем — від поштових спам-фільтрів і медичної діагностики до злиття GPS-сигналів і адаптивних рекомендаційних систем. Ця методологія бере початок від посмертної статті Томаса Баєса 1763 року і була незалежно розроблена П'єром-Симоном Лапласом.
Часті запитання
Що таке баєсове оновлення?
Баєсове оновлення — це процес перегляду оцінки ймовірності (апріорного розподілу) з урахуванням нових доказів для отримання оновленої оцінки (апостеріорного розподілу) за допомогою теореми Баєса: P(H|E) = P(E|H) · P(H) / P(E). Апріорний розподіл кодує все, у що ви вірили до спостереження даних, правдоподібність вимірює, наскільки ймовірними є спостережені дані за кожної гіпотези, а апостеріорний розподіл поєднує обидва. Найважливіше: сьогоднішній апостеріорний розподіл стає завтрашнім апріорним у міру надходження нових даних.
Як користуватися елементами керування симуляцією?
Налаштуйте повзунки апріорних α і β, щоб задати початкове переконання: α = β = 1 дає рівномірний (Uniform) апріорний розподіл, який вважає всі зміщення однаково ймовірними, а більше α відносно β кодує переконання, що монета схильна до орлів. Задайте Справжнє p як реальне приховане зміщення монети, тоді натискайте Підкинути 1, 5, 20 або 100, щоб накопичувати спостереження. Увімкніть Авто-підкидання, щоб спостерігати еволюцію апостеріорного розподілу в реальному часі, і натисніть Скинути, щоб очистити підкидання, зберігши налаштування апріорного розподілу.
Що означає 95% достовірний інтервал?
95% достовірний інтервал, показаний унизу графіка, означає, що з ймовірністю 95% — з урахуванням спостережених даних і апріорного розподілу — справжнє зміщення монети p потрапляє в цей діапазон. Це пряме твердження про ймовірність параметра, яке є баєсівською інтерпретацією. Воно відрізняється від частотного 95% довірчого інтервалу, який означає, що якби ви повторили експеримент багато разів, 95% побудованих інтервалів містили б справжнє значення — це твердження про процедуру, а не про конкретний інтервал.
Чому розподіл Beta є природним апріорним для зміщення монети?
Розподіл Beta визначений на інтервалі [0, 1] — саме на діапазоні ймовірності, а його два параметри форми α і β можна тлумачити як псевдорахунки апріорних орлів і решок. Найважливіше — це спряжений апріорний розподіл для біноміальної правдоподібності: множення апріорного Beta на біноміальну правдоподібність дає знову розподіл Beta. Ця спряженість означає, що оновлення апостеріорного розподілу вимагає лише двох додавань (α += k, β += n − k) замість чисельного інтегрування, що робить обчислення точним і миттєвим незалежно від кількості спостережених підкидань.
Де баєсове оновлення використовується в реальному світі?
Спам-фільтри використовують баєсове оновлення для оцінки ймовірності того, що слово (наприклад, «безкоштовно» чи «переможець») вказує на спам, уточнюючи оцінки в міру того, як користувач позначає листи. Медичне тестування використовує його для обчислення позитивної прогностичної цінності — ймовірності того, що позитивний результат тесту означає хворобу — поєднуючи чутливість тесту з апріорною поширеністю хвороби. У GPS-приймачах фільтр Калмана застосовує послідовні баєсові оновлення для злиття шумних супутникових сигналів із прогнозами моделі руху. Платформи A/B-тестування використовують баєсівські методи для оцінки апостеріорних розподілів конверсії та звітують достовірні інтервали замість p-значень.
Яке поширене хибне уявлення про баєсівську й частотну статистику?
Поширене хибне уявлення полягає в тому, що баєсівські методи є «суб'єктивними» і тому менш строгими за частотні. Насправді обидва підходи вимагають вибору моделі — частотники обирають тестову статистику й рівень значущості, баєсіанці обирають апріорний розподіл. Коли апріорний розподіл слабоінформативний або даних багато, апостеріорний розподіл визначається переважно правдоподібністю і сходиться до тієї ж відповіді, яку отримав би частотник. Справжня різниця — в інтерпретації: баєсіанці приписують ймовірності гіпотезам, що природно узгоджується з прийняттям рішень; частотники визначають ймовірність як довгострокову частоту, що уникає потреби задавати апріорний розподіл, але унеможливлює прямі ймовірнісні твердження про параметри.
Хто і коли відкрив баєсівський висновок?
Преподобний Томас Баєс (бл. 1701–1761) вивів основну теорему, але так і не опублікував її; його друг Річард Прайс знайшов рукопис і подав його до Королівського товариства, де він з'явився в Philosophical Transactions у 1763 році, через два роки після смерті Баєса. П'єр-Симон Лаплас незалежно перевідкрив і значно розширив цей підхід близько 1774 року, надавши йому математичну форму, якою ми користуємось сьогодні, і застосувавши його до задач від народжуваності до небесної механіки. Сучасний термін «баєсівська статистика» став поширеним лише у 1950–1960-х роках завдяки таким статистикам, як Гарольд Джеффріс, Леонард Севідж і Денніс Ліндлі.
Які ще симуляції пов'язані з баєсовим оновленням?
Байєсівський висновок (Prior, Likelihood та Posterior) на цьому сайті розширює ту саму методологію на неспряжені моделі. Симулятор нормального розподілу демонструє центральну граничну теорему, яка пояснює, чому апостеріорні розподіли для великих вибірок стають приблизно гаусовими незалежно від апріорного розподілу. Симулятор Монте-Карло π ілюструє інший метод імовірнісних міркувань — оцінку величин за допомогою випадкової вибірки замість замкнених апостеріорних розподілів. Дослідник імовірнісних розподілів дозволяє вивчити Beta-, Біноміальний та інші сімейства, що лежать в основі спряжених моделей.
Як баєсове оновлення використовується в машинному навчанні та ШІ?
Наївні баєсівські класифікатори застосовують теорему Баєса до класифікації тексту й документів, розглядаючи кожне слово як незалежний доказ. Баєсівські нейронні мережі задають розподіли на вагах мережі замість точкових оцінок, що дозволяє кількісно оцінювати невизначеність прогнозів. Гаусові процеси — які використовують у баєсівській оптимізації для налаштування гіперпараметрів — підтримують апостеріорний розподіл на цілих функціях і оновлюють його з кожним новим експериментом. Алгоритми навчання з підкріпленням, такі як Thompson Sampling, використовують вибірки з апостеріорного розподілу для балансування дослідження й використання в задачах багаторукого бандита, перевершуючи детерміновані epsilon-жадібні стратегії при обмежених даних.