🎓 Data Cleaning
Duplicate Detection
Methods: Exact duplicates, fuzzy matching.
Processing: Removal, preservation of one.
Importance: Critically for quality.
Inconsistency Detection
Types: Format inconsistencies, logical errors.
Processing: Standardization, validation rules.
Examples: Date formats, categorical values.
Data Validation
Checks: Range checks, type checks, constraints.
Goal: Detecting errors in early stages.
Application: Data quality assurance.
🔧 Transformation
Scaling & Normalization
StandardScaler: Mean equals zero, standard deviation equals one.
MinMaxScaler: Range between zero and one.
RobustScaler: Median-based, for outliers.
Encoding
One-Hot: For categorical variables without order.
Label: For categorical variables with order.
Target: Mean target per category.
Feature Transformation
Log: For skewed distributions.
Square Root: For count data.
Box-Cox: For normalization.
📚 Practical Examples
Example 1: Complete preprocessing pipeline
Cleaning: Remove duplicates, inconsistencies.
Missing: Impute missing values.
Outliers: Detect and handle outliers.
Transformation: Scaling, encoding.
Example 2: Handling missing values
Analysis: Identify patterns of missing values.
Imputation: Use mean/median/mode.
Indicator: Add indicator variables.
(c) 2025 Scientific Simulator. All rights reserved.
Data Preprocessing: Data preparation
Try it live
Everything above runs in your browser — open Dimensionality Reduction: PCA, t-SNE & UMAP and change the parameters while it is running. Nothing is installed, nothing is uploaded, the whole model lives in one tab.
▶ Open Dimensionality Reduction: PCA, t-SNE & UMAP simulation