Дослідіть алгоритми класифікації та розбиття даних через інтерактивну симуляцію
Інтерактивна Симуляція
200
5
10
Візуалізація Дерева
Розподіл Класів
Статистика Дерева
Кількість вузлів:0
Кількість листів:0
Глибина дерева:0
Середня глибина:0.00
Якість Моделі
Точність:0.00%
Precision:0.00%
Recall:0.00%
F1-Score:0.00%
Важливість Ознак
Побудуйте дерево для перегляду важливості ознак
Теоретичні Основи
Що таке дерево рішень?
Дерево рішень — це модель машинного навчання, що представляє правила класифікації
у вигляді дерева. Кожен внутрішній вузол представляє тест на ознаку, кожна гілка —
результат тесту, а кожен лист — клас.
Дерево рішень легко інтерпретувати, оскільки правила класифікації представлені
у зрозумілому вигляді "якщо-то".
Алгоритм побудови
Рекурсивне розбиття: Алгоритм рекурсивно розбиває дані на підмножини.
Вибір ознаки: На кожному кроці вибирається найкраща ознака для розбиття.
Критерій зупинки: Зупинка при досягненні листа або критеріїв зупинки.
Математичні Основи
Ентропія:
H(S) = -Σ pᵢ log₂(pᵢ)
Інформаційний виграш:
IG(S,A) = H(S) - Σ(|Sᵥ|/|S|)H(Sᵥ)
Індекс Gini:
Gini(S) = 1 - Σ pᵢ²
Часті Запитання
Gini: швидший обчислення, менш чутливий до розподілу класів. Entropy: теоретично обґрунтований, кращий для збалансованих даних. Log Loss: для ймовірнісних прогнозів. На практиці різниця невелика.
Overfitting виникає, коли дерево стає занадто складним і запам'ятовує навчальні дані. Методи боротьби: обмеження глибини, мінімальний розмір листа, обрізання дерева, використання ансамблевих методів.
Обрізання видаляє гілки, які не покращують узагальнювальну здатність. Cost-complexity pruning: додає штраф за складність. Reduced error pruning: видаляє гілки, що не покращують точність на валідаційному наборі.
Легка інтерпретація, обробка категоріальних та числових ознак, автоматичний вибір ознак, стійкість до відсутніх значень, швидке навчання та прогнозування, можливість обробки нелінійних залежностей.
Схильність до overfitting, нестабільність (малі зміни в даних можуть змінити структуру), нездатність до екстраполяції, дискретні прогнози, чутливість до шуму в даних.
Дерева рішень природно обробляють категоріальні ознаки через розбиття на категорії. Для багатьох категорій можна використовувати one-hot encoding або target encoding. Важливо уникати висококардинальних ознак.
Випадковий ліс — це ансамбль дерев рішень, де кожне дерево навчається на випадковій підмножині даних та ознак. Це зменшує overfitting, покращує стабільність та точність прогнозів.
Важливість ознаки вимірюється зменшенням критерію розбиття (Gini або Entropy). Вища важливість означає більший вплив на класифікацію. У випадковому лісі важливість більш надійна через усереднення.
Максимальна глибина: 3-10 залежно від складності задачі. Мінімальний розмір листа: 5-20 для запобігання overfitting. Мінімальний розмір розбиття: 10-50. Використовуйте крос-валідацію для оптимізації.
Медична діагностика, кредитне скорингування, маркетингові кампанії, технічна діагностика, фінансове моделювання, біологічна класифікація, рекомендаційні системи, аналіз ризиків.