Cel: Zapewnienie kompletnej wiedzy o technikach przetwarzania danych, w tym czyszczenia, transformacji i inżynierii cech.
Wprowadzenie do przetwarzania danych
Wprowadzenie do przetwarzania danych
Fasety przetwarzania danych
Oczyszczanie danych i obsługa błędów: oczyszczenie danych poprawia błędy i niezgodności; usuwanie duplikatów, poprawa powszechnych błędów, standardyzacja formatów, obsługa wartości niepoprawnych oraz walidacja danych zapewnia jakość danych do dalszej analizy.
Oczyszczanie danych dotyczy błędu i niezgodności: usuwanie duplikatów, poprawa powszechnych błędów, standardyzacja formatów, obsługa wartości niepoprawnych oraz walidacja danych. To zapewnia jakość danych do dalszej analizy.
Inżynieria cech i tworzenie nowych cech
Inżynieria cech tworzy nowe cechy na podstawie istniejących danych, aby poprawić modele: kombinacje cech, interakcje, cechy wielomianowe, grupowanie (binning), kodowanie kategorii, wyodrębnianie dat (dzień tygodnia, miesiąc) i agregacja. Przeprowadzona w sposób właściwy inżynieria cech znacznie poprawia jakość modeli.
Zarządzanie problematycznymi danymi
Często zadawane pytania
Mam zachować oryginalne dane?
Oryginalne dane powinny być zachowane.
Powiniemy przetestować na próbie walidacyjnej?
Przetestuj na próbie walidacyjnej.
Mam automatyzować procesy?
Automatyzuj procesy.
Jak zarządzać brakiem danych?
Jak zarządzać brakami danych?
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Decision Tree Live i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację Decision Tree Live