Wprowadzenie
Hyperparametry wyboru modelu kontrolują sposób porównywania, walidowania i wybierania różnych modeli. Te parametry determinują strategię oceny, metody ensemblesa oraz kryteria porównywania modeli. Rozumienie sposobu dostosowywania tych parametrów jest kluczowe dla budowania solidnych i wiarygodnych systemów uczenia maszynowego.
Parametry walidacji krzyżowej
Podzieli dane na k krotek do walidacji:
Zachowuje rozkład klas w każdej krotce:
Uzależnia się od porządku czasowego w serii czasowej:
Parametry ensemblu
Zespół drzew decyzyjnych:
Metoda sekwencyjna ensemblu:
Parametry porównywania modeli
Metryki oceny modelu:
Sposób podziału danych na walidację:
Znajdywanie parametrów hiperparametrów
Szukanie wyczerpujące poziomu parametrów:
Losowe pobieranie z przestrzeni parametrów:
Kryteria wyboru modelu
Zbalansuj dopasowanie i złożoność modelu:
Średnia wydajność po stronach skreślonych:
Parametry wyboru ensembłu
Zagregowuje przewidywania wielu modeli:
Używa metamodelu do zagregowania przewidywań:
Parametry trwałości modelu
Parametry zapisywania treningowych modeli:
Parametry ładowania zapisanych modeli:
Parametry wyboru modelu powinny być wybierane w zależności od cech danych, typu zadania i ograniczeń obliczeniowych. Używaj odpowiednich strategii walidacji i rozważ metody ensemblu do poprawy wydajności.
Strategie dostosowywania parametrów
Często zadawane pytania
Jak wybrać odpowiednią strategię walidacji krzyżowej?
Za pomocą KFold dla równych danych, StratifiedKFold dla klasyfikacji z niezrównoważonymi danymi, a TimeSeriesSplit dla serii czasowych. Wybierz 5-10 folderów w zależności od wielkości zbioru danych i ograniczeń obliczeniowych.
Jaką jest różnica między wyszukiwaniem siatkowym a losowym?
Wyszukiwanie siatkowe testuje wszystkie kombinacje parametrów w sposób empatyczny, podczas gdy wyszukiwanie losowe losuje z przestrzeni parametrów. Wyszukiwanie losowe jest często bardziej efektywne dla przestrzeni parametrów o dużej wielowymiarowości.
Jak porównać różne modele w sposób uczciwy?
Użyj takiej samej strategii walidacji krzyżowej, tych samych metryk oceny i tych samych podziałów danych. Użyj testów statystycznych, aby ustalić, czy różnice w wydajności mają znaczenie. Zatwierdź na zbiorniku testowym.
Kiedy powinienem używać metod ensemblistycznych?
Metody ensemblistyczne powinny być używane, gdy masz wiele dobrych modeli, chcesz zmniejszyć nadadapcję lub potrzebujesz bardziej zrównoważonych prognozy. Losowe drzewa decyzyjne i gradient boosting są dobrymi punktami wyjścia.
Jak wybrać odpowiednią metrykę oceny?
Użyj dokładności dla równych klasyfikacji, F1 dla danych niezrównoważonych, precyzji/powtarzalności w zależności od wymagań konkretnych i błędu średniokwadratowego/MAE dla regresji. Rozważ swoje cele biznesowe.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Model Selection Hyperparameters i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację Model Selection Hyperparameters