📊 Naiwny klasyfikator bayesowski — decyzja probabilistyczna
Klasyfikuj punkty 2D gaussowskim naiwnym klasyfikatorem Bayesa: oszacuj średnie i wariancje dla każdej klasy, zastosuj regułę Bayesa przy założeniu niezależności i zobacz granicę decyzyjną a posteriori.
O tej symulacji
Ta symulacja pokazuje gaussowski naiwny klasyfikator Bayesa uczący się rozdzielać punkty na 2 lub 3 klasy. Dla każdej klasy dopasowuje średnią i wariancję wzdłuż osi x i y na podstawie dostarczonych punktów, traktując obie osie jako warunkowo niezależne przy danej klasie — to właśnie założenie „naiwne”. Każdy piksel jest następnie kolorowany zgodnie z klasą o najwyższym prawdopodobieństwie a posteriori według reguły Bayesa, przy czym intensywność cieniowania pokazuje pewność modelu, a odczyt dokładności na żywo śledzi, jak dobrze dopasowany model klasyfikuje ponownie własne punkty treningowe.
🔬 Co pokazuje
Powierzchnię decyzyjną zbudowaną z rozkładów Gaussa dla każdej klasy. Każda klasa otrzymuje znacznik średniej i elipsę odchylenia standardowego obliczoną z jej punktów; kolorowe tło to region argmax-a posteriori dla każdego piksela, a ponieważ każda klasa może mieć własną wariancję, granica między klasami jest krzywą, a nie linią prostą.
🎮 Jak korzystać
Wybierz preset (2 skupiska, 3 skupiska lub Overlap) lub kliknij na płótnie, aby umieścić własne punkty w wybranej klasie za pomocą przycisków klas. Użyj suwaka Classes, aby przełączać się między 2 a 3 kategoriami, a następnie naciśnij Fit model, aby przeliczyć rozkłady Gaussa i granicę decyzyjną, Clear points, aby zacząć od pustego zbioru, lub Reset, aby ponownie wczytać bieżący preset.
💡 Czy wiesz, że?
Naiwny Bayes zakłada niezależność cech przy danej klasie, nawet gdy tak nie jest — na przykład wzrost i waga są w rzeczywistości skorelowane — a mimo to klasyfikator jest w praktyce często nadal dokładny, a jego szybkość i prostota sprawiają, że pozostaje popularnym punktem odniesienia w klasyfikacji tekstu i spamu.
Najczęściej zadawane pytania
Czym jest naiwny klasyfikator Bayesa?
Naiwny klasyfikator Bayesa przypisuje każdy punkt do klasy o najwyższym prawdopodobieństwie a posteriori, obliczanym z reguły Bayesa jako proporcjonalnym do prawdopodobieństwa a priori klasy pomnożonego przez wiarygodność cech punktu w tej klasie. Nazywa się „naiwny”, ponieważ zakłada, że cechy są warunkowo niezależne przy danej klasie, co upraszcza wiarygodność do iloczynu prawdopodobieństw dla poszczególnych cech.
Jak ta symulacja szacuje prawdopodobieństwa?
Dla każdej klasy oblicza średnią i wariancję współrzędnych x i y jej punktów, a następnie modeluje każdą oś jako niezależny rozkład Gaussa. Prawdopodobieństwo a priori klasy to po prostu ułamek wszystkich punktów należących do tej klasy. Pomnożenie prawdopodobieństwa a priori przez dwie wiarygodności Gaussa daje (nieznormalizowane) prawdopodobieństwo a posteriori używane do klasyfikacji dowolnej lokalizacji.
Dlaczego granica decyzyjna jest zakrzywiona, a nie prosta?
Gdy klasy mają różne wariancje, wyrazy wiarygodności Gaussa nie znoszą się liniowo, więc granica argmax-a posteriori staje się krzywą, zwykle w kształcie paraboli lub łuku elipsy. Ta kwadratowa granica jest cechą charakterystyczną gaussowskiego naiwnego Bayesa i jest widoczna w symulacji, gdy rozrzuty klas się różnią, na przykład w presecie Overlap.
Co oznacza procent dokładności?
Po naciśnięciu Fit model symulacja klasyfikuje ponownie każdy punkt treningowy, używając dopasowanych rozkładów Gaussa, i podaje ułamek punktów, które trafiają z powrotem do swojej pierwotnej klasy. Jest to dokładność treningowa, nie dokładność na nowych, niewidzianych danych, więc wskazuje głównie, jak dobrze bieżący model Gaussa rozdziela narysowane przez Ciebie klasy.
Czy mogę dodać więcej niż 3 klasy lub narysować własne dane?
Suwak Classes obsługuje 2 lub 3 kategorie, a w każdej chwili możesz kliknąć w dowolnym miejscu płótna, aby dodać punkt do klasy wybranej w selektorze klas. Pozwala to zbudować niestandardowe, być może nakładające się lub nieregularnie ukształtowane rozkłady i zobaczyć, jak dopasowane rozkłady Gaussa i granica decyzyjna dostosowują się po naciśnięciu Fit model.