Wprowadzenie
Teoria statystyczna uczenia się dostarcza teoretyczne podstawy do zrozumienia generalizacji w uczeniu maszynowym. Te zasady stosują się również do optymalizacji hiperparametrów, wyjaśniając, dlaczego zbiory walidacyjne działają i jak osiągnąć dobry stopień generalizacji.
Błąd generalizacji
Oczekiwany stratę na rozkładzie D.
Średnią stratę na próbie S.
Granice generalizacji
Z prawdopodobieństwem 1-δ:
Gdzie d_VC to wymiar Vapnik-Chervonenkis.
Nauka prawdopodobnie przybliżona (PAC)
Nauka prawdopodobnie przybliżona (PAC):
Jednorodne zbieżność
Błąd empiryczny jednorodnie bliski prawdziwemu błędu:
Kompleksowość Rademachera
Miara złożoności klasy funkcji.
Teoria statystycznej nauki wyjaśnia, dlaczego optymalizacja hiperparametrów na zestawach walidacyjnych generalizuje się. Granice generalizacji kwantyfikują zagadnienie trade-off między złożonością modelu a wielkością próby.
Przezroczystość vs Wariancja
Regulacja parametrów początkowych:
Teoria walidacji krzyżowej
Niezbierna ocena błędu generalizacji:
Wiele przekrojów zmniejsza wariancję:
Często zadawane pytania
Czym jest błąd generalizacji?
Błąd generalizacji R(λ) = E[L(f_λ(x), y)] to oczekiwany straty na danych niezobserwowanych. Miara tego, jak dobrze model wykonuje się w nowych przykładach poza danymi treningowymi.
Czym są granice generalizacji?
Granice generalizacji relacjonują prawdziwy błąd R(λ) z empirycznym błędem R̂_S(λ) z prawdopodobieństwem wysokim: R(λ) ≤ R̂_S(λ) + term_złożoności. Oceńają one zdolność do generalizacji.
Czym jest uczenie PAC?
Uczenie PAC (Probably Approximately Correct) oznacza uczenie z prawdopodobieństwem wysokim (prawdopodobnie) do blisko optimalnego (przybliżonego poprawnego). Złożoność próbek: n ≥ (1/ε) log(|Λ|/δ).
Czym jest wymiar VC?
Wymiar VC (Vapnik-Chervonenkis) oznacza złożoność modelu - maksymalna liczba punktów, które można zniszczyć. Występuje on w granicach generalizacji: R(λ) ≤ R̂_S(λ) + O(√(d_VC/n)).
Czym jest złożoność Rademacher?
Złożoność Rademacher oznacza złożoność klasy funkcji używając losowych znaków. Występuje ona w granicach generalizacji i dostarcza bardziej precyzyjne ograniczenia niż wymiar VC w wielu przypadkach.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Statistical Learning Theory for Hyperparameter Optimization i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację Statistical Learning Theory for Hyperparameter Optimization