Wprowadzenie
Regularyzujące hiperparametry kontrolują siłę technik regularyzacji, które zapobiegają nadpasowaniu i poprawiają zasady modelu. Te parametry są kluczowe dla osiągnięcia dobrych wyników na danych niewidzianych i wymagają starannego dostosowywania.
Regularizacja typu L1 (Lasso)
Regularizacja typu L1 dodaje sumę wartości bezwzględnych parametrów do funkcji straty:
Gdzie λ₁ to siła regularizacji typu L1.
Regularizacja L2 (Ridge)
Regularizacja L2 dodaje sumę kwadratów parametrów do funkcji straty:
Gdzie λ₂ to siła regularizacji L2.
Regularyzacja Elastic Net
Złącza regularyzację L1 i L2:
Regularyzacja dropoutu
Losowo ustawia część jednostek wejściowych na 0 podczas treningu:
Znormalizowanie warstw
Znormalizuje wejścia dla każdego warstwy:
Gdzie γ i β są parametrami uczonymi.
Zatrzymanie wczesne
Zatrzymaj trening, gdy wydajność na zbiorze walidacyjnym przestanie poprawiać się:
Augmentacja danych
Zwiększenie szkoleniowych danych poprzez transformacje:
Parametry regularizacji wymagają dokładnej regulacji, aby zrównoważyć białosć i wariancję. Zaczynaj od konserwatywnych wartości, monitoruj wydajność walidacyjną i dostosowuj się do sygnałów nadadapowania/ niedasadapowania.
Strategie regularyzacji dojustowania
Często zadawane pytania
Czym jest regularizacja w uczeniu maszynowym?
Regularizacja zapobiega nadadapacji dodając do funkcji straty terminy karne. Popularne rodzaje to L1 (sparsencja), L2 (gładkość), dropout (losowe dezaktywowanie) i zatrzymanie wcześniejsze.
Jak się różnią regularizacja L1 i L2?
Regularizacja L1 (Lasso) dodaje sumę wartości bezwzględnych parametrów, co promuje sparsencję i wybor cech. Regularizacja L2 (Ridge) dodaje sumę kwadratów parametrów, co promuje rozwiązania gładkie bez sparsencji.
Jak mogę wybrać siłę regularizacji?
Zacznij od małych wartości (0.001-0.01), używaj walidacji krzyżowej, aby znaleźć optymalną siłę, monitoruj wydajność walidacyjną i dostosuj na podstawie znaków nadadapacji lub niedoadapacji.
Czym jest dropout i jak działa?
Dropout losowo ustawia część jednostek wejściowych na 0 podczas treningu, zapobiegając kooperacji i działając jako metoda sztucznej ensemblizacji. Typowe stopy to 0.1-0.5 w zależności od położenia warstwy.
Mam używać wielu technik regularizacji razem?
Tak, kombinacja technik często działa lepiej niż jedna tylko. Na przykład, używaj regularizacji L2 z dropout, lub łączenie zatrzymania wcześniejszego z wzmocnieniem danych. Zaczynaj prosto i dodawaj złożoność stopniowo.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Regularization Hyperparameters i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację Regularization Hyperparameters