Zasada iloczynowa, dwa razy
Wszystko zaczyna się od definicji prawdopodobieństwa warunkowego: P(A|B) = P(A ∩ B) / P(B). Ta sama wspólna zmienna prawdopodobieństwa P(H ∩ E) może być zapisana na dwa sposoby – jako P(E|H)·P(H) lub jako P(H|E)·P(E) – i ustawienie ich równości daje twierdzenie Bayesa:
P(H|E) = P(E|H) · P(H) / P(E) H = hipoteza (to, co chcesz zbadać) E = dowód (to, co zaobserwowałeś) P(E) = Σᵢ P(E|Hᵢ)·P(Hᵢ) ← stała normalizująca To jest całe twierdzenie – zasada iloczynowa zastosowana dwa razy. Jej siła pochodzi w pełni z wyboru, na czym się warunkujemy: H to hipoteza (model, diagnoza, skłonność monety), E to dowód, który faktycznie zaobserwowano.
P(H|E) = P(E|H) · P(H) / P(E) H = hypothesis (what you care about) E = evidence (what you observed) P(E) = Σᵢ P(E|Hᵢ)·P(Hᵢ) ← normalising constant
A priori, prawdopodobieństwo, a posteriors
A priori P(H) to to, w co wierzyłeś przed danymi. Prawdopodobieństwo (likelihood) P(E|H) to prawdopodobieństwo wystąpienia dowodu, jeśli H jest prawdziwe – to, co model przewiduje. Posterior P(H|E) to Twoja zaktualizowana wiara i staje się a priori dla kolejnego obserwacji. Mianownik P(E), marginalne prawdopodobieństwo, jest taki sam dla każdej hipotezy i po prostu normalizuje posterior do sumy 1.
Fałszywa wnioskowość bazowa: pozytywny wynik nie jest dowodem
Choroba dotyka 1% populacji. Test ma 99% czułości i 98% specyficzności. Przy założeniu pozytywnego wyniku, jaka jest szansa, że faktycznie się z nią rozchorowałeś?
P(+) = 0.99 × 0.01 + 0.02 × 0.99 = 0.0297 P(D|+) = 0.99 × 0.01 / 0.0297 ≈ 0.333 → tylko 33%! Pomimo wysokiej dokładności testu, jeden pozytywny wynik oznacza jedynie 33% szansę na chorobę, ponieważ choroba jest rzadka – niski wcześniejszy prawdopodobieństwo dominuje. Wykonaj ponownie test i użyj 0.33 jako nowego wcześniejszego prawdopodobieństwa: drugi pozytywny wynik podnosi P(D++) do około 96%. To właśnie jest punkt sekwencyjnego aktualizowania Bayesa, a pomijanie wcześniejszego prawdopodobieństwa – fałszywa wnioskowość bazowa – prowadzi do szalenie przesadnie pewnych diagnoz.
P(+) = 0.99×0.01 + 0.02×0.99 = 0.0297 P(D|+) = 0.99×0.01 / 0.0297 ≈ 0.333 → only 33%!
Konjugaty – aktualizacje bez integracji
Gdy wcześniejsza i późniejsza przynależą do tej samej rodziny rozkładów, wcześniejszą nazywamy koniugetną względem prawdopodobieństwa, a aktualizacja nie wymaga żadnej integracji numerycznej. Rzuć monetę n razy, zaobserwuj k głów, a jeśli wcześniejsza dotycząca skoruścią θ jest Beta(α, β), to późniejsza jest po prostu Beta(α + k, β + n − k). Jednolita wcześniejsza (α = β = 1) daje średnią późniejszą (k+1)/(n+2) – wygładzanie Laplace’a. Inne klasyczne pary: prawdopodobieństwo Gaussa + wcześniejsza Gaussa → późniejszy rozkład Gaussa (filtr Kalmana liniowy); prawdopodobieństwo Poissona + wcześniejszy rozkład Gamma → późniejszy rozkład Gamma; Kategoriczny + Dirichlet → Dirichlet (modele językowe).
Bayesowska Inferencia: Prior, Prawdopodobieństwo i Posterior Wyjaśnione
Spam filter to przykład zastosowania twierdzeniowej Bayesowskiego krok po kroku: P(spam|słowa) ∝ P(spam) × Π P(słowa|spam), zakładając, że wystąpienia słów są warunkowo niezależne pod względem klasy – założenie "naiwne". Z użyciem Laplace'a wygładzania, aby uniknąć zerowych prawdopodobieństw dla niewidzianych słów, ten prosty model klasyfikuje „zaśnienie o pieniądzach” jako spam a „przegląd agendy spotkania w biurze” jako boczne – wszystko to na podstawie proporcji liczenia słów wyuczone z małego zbioru treningowego.
Frequently asked questions
Jakie jest różnice między wcześniejszą wiarygodnością (prior), prawdopodobieństwem i nową wiarygodnością (posterior)?
Wcześniejsza wiarygodność P(H) to Twoje przekonanie o hipotezie przed uwzględnieniem danych. Prawdopodobieństwo obserwowanej dowodów, przy założeniu prawdziwości hipotezy P(E|H), mierzy się w tym przypadku. Nowa wiarygodność P(H|E) to zaktualizowane przekonanie po połączeniu tych dwóch elementów za pomocą twierdzenia Bayesa – staje się ona nową wcześniejszą wiarygodnością dla kolejnego obserwacji.
Dlaczego pozytywny wynik testu medycznego nie oznacza, że cierpisz na chorobę?
Jest to błąd bazowego prawdopodobieństwa (base-rate fallacy). Nawet test z 99% czułością i 98% specyficznością, zastosowany do choroby o 1% zachodzeniu się, daje jedynie 33% szansy na rzeczywiste zachorowanie przy pozytywnym wyniku – ponieważ niskie wcześniejsze prawdopodobieństwo choroby dominuje w obliczeniach. Twierdzenie Bayesa sprawia to wyraźnie, gdzie intuicja często zawodzi.
Co czyni wiarygodność (prior) 'konjugowaną' do prawdopodobieństwa?
Wiarygodność jest konjugowana do prawdopodobieństwa, gdy nowa wiarygodność należy do tej samej rodziny rozkładu co wcześniejsza, umożliwiając zamknięte wzory aktualizacji bez konieczności wykonywania integracji numerycznej. Klasycznym przykładem jest wiarygodność Beta z prawdopodobieństwem Binominalnym, która zawsze daje wiarygodność Beta – wystarczy dodać obserwowane sukcesy i porażki do parametrów wiarygodności Beta.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz the simulation i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację the simulation