Wprowadzenie
Hyperparametry przetwarzania danych regulują sposób transformacji oryginalnych danych przed treningiem modelu. Te parametry znacznie wpływają na wydajność modelu, efektywność treningu i zdolność do generalizacji. Zrozumienie sposobu dostosowywania parametrów przetwarzania jest kluczowe dla budowania skutecznychpipelin uczenia maszynowego.
Skalowanie parametrów
Normalizuje cechy do średniej równej zero i wariancji równej jedności:
Skaliuje cechy do zakresu [0, 1]:
Używa mediany i IQR do skalowania:
Parametry kodowania
Tworzy kolumny binarne dla zmiennych kategoryzacyjnych:
Mapuje kategorie na liczby całkowite:
Koduje kategorie używając statystyk docelowych:
Parametry inżynierii cech
Tworzy kombinacje wielomianowe:
Wybiera najważniejsze cechy:
Parametry uzupełniania brakujących wartości
Wypełnia braki wartościami:
Używa k-najbliższych sąsiadów do uzupełniania:
Parametry zredukowania wymiarowości
Analiza głównych komponent:
Linieara dyskryminantowa analiza:
Parametry przetwarzania tekstu w uczeniu maszynowym
Częstotliwość słowa-i odwrotna częstotliwość dokumentu:
liczy wystąpienia słów:
Parametry przetwarzania obrazów
Zmienia rozmiary obrazów do ustalonego wymiaru:
Normalizuje wartości pikseli:
Strategie dostosowywania parametrów
Parametry przetwarzania danych powinny być dostosowywane jako część całościowego pipeline. Użyj walidacji krzyżowej, aby uniknąć przepływu danych i upewnić się, że transformery są dopasowywane tylko do danych treningowych.
Często zadawane pytania
Jaką skalę powinienem użyć?
Skorzystaj z StandardScaler dla normalnych danych, MinMaxScaler dla danych ograniczonych, RobustScaler dla danych zawierających odstojenia. Testuj kilka skali i wybierz na podstawie wydajności walidacyjnej.
Jak zarządzać zmiennymi kategorialnymi?
Skorzystaj z kodowania jednokrotnego dla nominałów, kodowania etykietowego dla porządkowych i kodowania na podstawie docelowej dla zmiennych o wysokiej ilości kategorii. Rozważ liczbę kategorii i wymagania modelu.
Jak najlepiej zarządzać brakującymi wartościami?
Skorzystaj z SimpleImputer w przypadku prostych przypadków, KNNImputer dla skomplikowanych wzorców lub imputacji opartej na modelu. Rozważ wzór braku danych i cechy danych.
Jak wybrać komponenty PCA?
Użyj stopy wariancji (na przykład 0,95) do zachowania 95% wariancji, lub określ liczbę komponentów. Wykreśl wariancję wyjaśnioną, aby wskazać wybór. Rozważ ograniczenia obliczeniowe.
Jakie są dobre parametry TF-IDF?
Zacznij od max_features=10000, ngram_range=(1,2), min_df=2, max_df=0,95. Ajustuj na podstawie wielkości słownika, długości dokumentu i zasobów obliczeniowych.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Data Preprocessing Hyperparameters i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację Data Preprocessing Hyperparameters