Вступ
Параметри попередньої обробки даних контролюють, як сирості дані трансформуються перед навчанням моделі. Ці параметри значно впливають на продуктивність моделі, ефективність навчання та здатність до узагальнення. Розуміння того, як налаштувати параметри попередньої обробки, є ключем до створення ефективних систем машинного навчання.
Параметри масштабування
Стандартизує ознаки до середнього значення та одиничної дисперсії:
Масштабує ознаки в діапазон [0, 1]:
Використовує медіану та IQR для масштабування:
Кодування параметрів
Створює бінарні стовпці для категоріальних змінних:
Присвоює категорії цілим числам:
Кодує категорії за допомогою цільових статистик:
Параметри інженерії ознак
Створює комбінації поліноміальних членів:
Вибирає найважливіші ознаки:
Параметри імпутації
Заповнює відсутні значення:
Використовує k-найближчих сусідів для імпутації:
Параметри зменшення розмірності
Метод головних компонент (PCA):
Лінейна дискримінантна аналіз (LDA):
Параметри попередньої обробки даних
Термін частоти - обернена частота документів:
Рахунок кількості входжень слів:
Параметри попередньої обробки зображень
Змінює розмір зображень на фіксовані розміри:
Нормалізує значення пікселів:
Стратегії налаштування параметрів
Параметри попередньої обробки слід налаштовувати як частина загальної конфігурації. Використовуйте перехресні валідації, щоб запобігти витоку даних і забезпечити, щоб трансформатори були підготовлені лише на навчальних даних.
Часті запитання
Який скалер слід використовувати?
Використовуйте StandardScaler для нормальних даних, MinMaxScaler для обмежених даних і RobustScaler для даних з викидами. Протестуйте кілька скалерів і виберіть на основі результатів валідації.
Як обробляти категоріальні змінні?
Використовуйте one-hot encoding для номінальних змінних, label encoding для рангових змінних і target encoding для змінних з високою кардинальністю. Враховуйте кількість категорій та вимоги моделі.
Який найкращий спосіб обробляти відсутні значення?
Використовуйте SimpleImputer для простих випадків, KNNImputer для складних закономірностей або імпутацію на основі моделі. Враховуйте структуру відсутності та характеристики даних.
Як вибрати компоненти PCA?
Використовуйте коефіцієнт варіації (наприклад, 0,95), щоб зберегти 95% варіації або вкажіть кількість компонентів. Побудуйте графік поясненої дисперсії для керування вибором. Враховуйте обчислювальні обмеження.
Які хороші параметри TF-IDF?
Почніть з max_features=10000, ngram_range=(1,2), min_df=2, max_df=0,95. Налаштуйте відповідно до розміру словника, довжини документів та обчислювальних ресурсів.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте the simulation і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію the simulation