🧩 Wyczyścienie danych
Wykrywanie duplikatów
Metody: Duplikaty dokładne, pasywna dopasowanie.
Obsługa: Usuwanie, zachowanie jednego.
Wartość: Krytyczna dla jakości.
Wykrywanie niezgodności
Typy: Niezgodności formatowe, błędy logiczne.
Obsługa: Standardyzacja, zasady walidacji.
Przykłady: Formaty dat, wartości kategoryczne.
Walidacja danych
Sprawdzenia: Sprawdzanie zakresu, typów, ograniczeń.
Cel: Wykrywanie błędy w wcześniejszych etapach.
Zastosowanie: Gwarancja jakości danych.
Transformacja
Skalowanie & Normalizacja
StandardScaler: Średnia równa zero, odchylenie standardowe równo jeden.
MinMaxScaler: Zakres między zerem a jedynką.
RobustScaler: Opierany na medianie, dla wykrywania odstępstw.
Kodowanie
One-Hot: Dla zmiennych kategorialnych bez porządku.
Label: Dla zmiennych kategorialnych z porządkiem.
Cel: Średnia celu dla danej kategorii.
Transformacja cech
Logarytm: Dla rozkładów przesuniętych.
Pierwiastek kwadratowy: Dla danych liczebności.
Box-Cox: Dla normalizacji.
📚 Praktyczne przykłady
Przykład 1: Pełny proces przetwarzania wcześniejszego
Czyszczenie: Usuwanie duplikatów, niezgodności.
Braki: Wypełnianie brakujących wartości.
Wspornictwo: Znajdowanie i obsługa wsporników.
Transformacja: Skalowanie, kodowanie.
Przykład 2: Obsługa brakujących wartości
Analiza: Znalezienie wzorów brakujących wartości.
Wypełnianie: Używanie średniej/mediana/wartości dominującej.
Indeksy: Dodawanie zmiennych indeksacyjnych.
Spróbuj to na żywo
Wszystko powyżej działa w Twojej przeglądarce — otwórz Dimensionality Reduction: PCA, t-SNE & UMAP i zmieniaj parametry podczas jego działania. Nie ma potrzeby instalowania niczego ani przesyłania danych, cała modelizacja istnieje w jednym okienku.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Dimensionality Reduction: PCA, t-SNE & UMAP i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację Dimensionality Reduction: PCA, t-SNE & UMAP