Strona głównaArtykułyData Science

Evaluacja Modeli i Ocena Modeli

Ta sekcja szczegółowo opisuje metody oceny jakości i wiarygodności modeli, w tym kluczowe metryki i najlepsze praktyki walidacji.

mysimulator teamZaktualizowano — czerwiec 2026≈ 3 min czytania▶ Otwórz symulację

🎓 Metryki klasyfikacyjne

**Dokładność:** Ogólna poprawność modelu (prawdziwe pozytywy + prawdziwe negatywy) podzielona przez całą liczbę prognoz (prawdziwe pozytywy + prawdziwe negatywy + fałszywe pozytywy + fałszywe negatywy).

**Precyzja:** Prawdziwe pozytywy / (Prawdziwe pozytywy + Fałszywe pozytywy) - miara proporcji prawidłowych prognoz pozytywnych w stosunku do wszystkich prognoz pozytywnych.

**Sens:** Prawdziwe pozytywy / (Prawdziwe pozytywy + Fałszywe negatywy) - miara proporcji rzeczywistych przypadków pozytywnych, które zostały prawidłowo rozpoznane.

**F1-Score:** Świadcząca średnia między precyzją a sensem, dostarczająca zbalansowanej mierki wydajności modelu.

**ROC-AUC:** Pole pod krzywą funkcji charakterystycznej odbioru (ROC), używane do rankingu modeli w oparciu o ich zdolność do rozróżniania klas.

**Użycie:** F1 jest przydatne, gdy trzeba zbalansować precyzję i sens. ROC-AUC jest najbardziej odpowiedniem dla rankingu modeli.

demo na żywo · powiązana symulacja● LIVE

🔧 Metryki regresji

**MAE: Błąd bezwzględny średni**, srednia bezwzględna różnica między przewidzanymi i rzeczywistymi wartościami.

**RMSE: Pierwiastek z wariancji kwadratowej średniej**, pierwiastek z średniej wartości kwadratowej różnicy między przewidzanymi i rzeczywistymi wartościami – czuły na odstępy.

**Wybór:** MAE jest preferowany w przypadku, gdy błędy są rozłożone jednorodnie, a RMSE lepiej funguje w sytuacjach, gdy duże błędy mają znaczny wpływ.

**R²: Stosunek zdecydowania**, reprezentuje proporcję wariancji zmiennej zależnej wyjaśnionej przez model (zakres 0 do 1).

**MAPE: Błąd bezwzględny procentowy średni**, oblicza średni procentowy błąd między przewidzanymi i rzeczywistymi wartościami – przydatne do porównywania modeli na różnych skalach.

**Użycie:** R² dostarcza ogólnej miary dopasowania, a MAPE oferuje porównanie procentowe.

📚 Praktyczne przykłady

**Przykład 1: Ocena klasyfikatora** – Aby ocenić model klasyfikacyjny, najpierw podzielić zestaw danych na zbiór treningowy i testowy.

**Trening:** Trening modelu na danych treningowych.

**Ocena:** Obliczenie precyzji, czułości oraz F1-score, a następnie wygenerowanie macierzy błędu za pomocą danych testowych.

**Macierz błędu:** Wizualizacja błędów, pokazująca prawdziwe pozytywy, fałszywe pozytywy, prawdziwe negatywy i fałszywe negatywy.

**Przykład 2: Zastosowanie walidacji krzyżowej** – Aby ocenić stabilność modelu, użyj technik walidacji krzyżowej.

**K-fold:** Podzielenie zestawu danych na K krotek (na przykład 5 lub 10). Trening na K-1 krotce i testowanie na pozostałej krotce.

**Walidacja krzyżowa:** Powtarzanie procesu k-fold wielokrotnie, z rotacją, która krotka jest używana do testowania w każdym przebiegu.

**Ocena:** Obliczenie średnich miar po wszystkich K iteracjach, aby uzyskać bardziej wiarygodną ocenę wydajności modelu.

Spróbuj to na żywo

Wszystko powyżej działa w Twojej przeglądarce — otwórz Model Evaluation ROC Space i zmieniaj parametry podczas jego działania. Nie ma nic do zainstalowania, nie jest wysyłana żadna informacja, całe modelowanie mieści się w jednym oknie.

Wypróbuj na żywo

Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Model Evaluation ROC Space i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.

▶ Otwórz symulację Model Evaluation ROC Space

Co znalazłeś?

Dodaj kroki odtworzenia (opcjonalnie)