🎓 Metryki klasyfikacyjne
**Dokładność:** Ogólna poprawność modelu (prawdziwe pozytywy + prawdziwe negatywy) podzielona przez całą liczbę prognoz (prawdziwe pozytywy + prawdziwe negatywy + fałszywe pozytywy + fałszywe negatywy).
**Precyzja:** Prawdziwe pozytywy / (Prawdziwe pozytywy + Fałszywe pozytywy) - miara proporcji prawidłowych prognoz pozytywnych w stosunku do wszystkich prognoz pozytywnych.
**Sens:** Prawdziwe pozytywy / (Prawdziwe pozytywy + Fałszywe negatywy) - miara proporcji rzeczywistych przypadków pozytywnych, które zostały prawidłowo rozpoznane.
**F1-Score:** Świadcząca średnia między precyzją a sensem, dostarczająca zbalansowanej mierki wydajności modelu.
**ROC-AUC:** Pole pod krzywą funkcji charakterystycznej odbioru (ROC), używane do rankingu modeli w oparciu o ich zdolność do rozróżniania klas.
**Użycie:** F1 jest przydatne, gdy trzeba zbalansować precyzję i sens. ROC-AUC jest najbardziej odpowiedniem dla rankingu modeli.
🔧 Metryki regresji
**MAE: Błąd bezwzględny średni**, srednia bezwzględna różnica między przewidzanymi i rzeczywistymi wartościami.
**RMSE: Pierwiastek z wariancji kwadratowej średniej**, pierwiastek z średniej wartości kwadratowej różnicy między przewidzanymi i rzeczywistymi wartościami – czuły na odstępy.
**Wybór:** MAE jest preferowany w przypadku, gdy błędy są rozłożone jednorodnie, a RMSE lepiej funguje w sytuacjach, gdy duże błędy mają znaczny wpływ.
**R²: Stosunek zdecydowania**, reprezentuje proporcję wariancji zmiennej zależnej wyjaśnionej przez model (zakres 0 do 1).
**MAPE: Błąd bezwzględny procentowy średni**, oblicza średni procentowy błąd między przewidzanymi i rzeczywistymi wartościami – przydatne do porównywania modeli na różnych skalach.
**Użycie:** R² dostarcza ogólnej miary dopasowania, a MAPE oferuje porównanie procentowe.
📚 Praktyczne przykłady
**Przykład 1: Ocena klasyfikatora** – Aby ocenić model klasyfikacyjny, najpierw podzielić zestaw danych na zbiór treningowy i testowy.
**Trening:** Trening modelu na danych treningowych.
**Ocena:** Obliczenie precyzji, czułości oraz F1-score, a następnie wygenerowanie macierzy błędu za pomocą danych testowych.
**Macierz błędu:** Wizualizacja błędów, pokazująca prawdziwe pozytywy, fałszywe pozytywy, prawdziwe negatywy i fałszywe negatywy.
**Przykład 2: Zastosowanie walidacji krzyżowej** – Aby ocenić stabilność modelu, użyj technik walidacji krzyżowej.
**K-fold:** Podzielenie zestawu danych na K krotek (na przykład 5 lub 10). Trening na K-1 krotce i testowanie na pozostałej krotce.
**Walidacja krzyżowa:** Powtarzanie procesu k-fold wielokrotnie, z rotacją, która krotka jest używana do testowania w każdym przebiegu.
**Ocena:** Obliczenie średnich miar po wszystkich K iteracjach, aby uzyskać bardziej wiarygodną ocenę wydajności modelu.
Spróbuj to na żywo
Wszystko powyżej działa w Twojej przeglądarce — otwórz Model Evaluation ROC Space i zmieniaj parametry podczas jego działania. Nie ma nic do zainstalowania, nie jest wysyłana żadna informacja, całe modelowanie mieści się w jednym oknie.
▶ Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Model Evaluation ROC Space i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.