🔬 Кластеризація
K-Means
Розділяє дані на k кластерів. Ітеративно: центроїди → призначення до найближчих → оновлення центроїдів. Простий, швидкий, але потребує знання k, чутливий до ініціалізації. Широко використовується.
Hierarchical Clustering
Побудова дерева кластерів (дендрограма). Agglomerative (знизу вгору) або divisive (зверху вниз). Не потребує знання кількості кластерів. Показує ієрархію спільнот.
DBSCAN
Густинна кластеризація: знаходить кластери довільної форми на основі щільності. Виділяє шум (outliers). Не потребує знання k, добре для складних форм. Параметри: minPts, ε.
Gaussian Mixture Models
Ймовірнісна модель: кластери як гаусові розподіли. Soft assignment (ймовірність належності). Більш гнучкий за k-means, може обробляти перекриваючі кластери.
🎯 Зменшення розмірності
PCA (Principal Component Analysis)
Лінійне зменшення розмірності через знаходження основних напрямків варіації. Зберігає максимальну інформацію у меншому просторі. Використовується для візуалізації, feature extraction, noise reduction.
t-SNE
Нелинійне зменшення розмірності для візуалізації. Зберігає локальні відстані, корисний для дослідницького аналізу. Використовується для візуалізації високовимірних даних у 2D/3D.
Autoencoders
Нейронні мережі для зменшення розмірності: encoder стискає, decoder відновлює. Навчається мінімізувати помилку реконструкції. Нелінійне, може знаходити складні патерни. Використовується для feature learning.
UMAP
Uniform Manifold Approximation and Projection — нелінійне зменшення розмірності. Краща за t-SNE для збереження глобальної структури, швидший. Альтернатива для візуалізації та передобробки.
💻 Генеративні моделі
GAN (Generative Adversarial Networks)
Дві мережі: генератор створює, дискримінатор розрізняє справжні/згенеровані. Adversarial training покращує генерацію. Застосування: генерація зображень, стиль transfer, data augmentation.
Variational Autoencoders (VAE)
Autoencoder з ймовірнісним latent space. Генерує нові зразки через sampling. Можливість контролю генерації. Використовується для генерації, representation learning.
Diffusion Models
Генерація через поступову денойзинг. Навчається видаляти шум у послідовних кроках. Висока якість генерації (DALL-E 2, Stable Diffusion). Становляться домінуючими для генерації.
🏭 Застосування
Сегментація
Кластеризація клієнтів, користувачів для персоналізації. Маркетинг, рекомендації. Знаходження груп з подібною поведінкою без попередніх знань.
Виявлення аномалій
Знаходження незвичайних патернів (fraud detection, system monitoring). Використання кластеризації або autoencoders. Важливо для безпеки, якості.
Feature Learning
Autoencoders для автоматичного виділення ознак. Pre-training для supervised задач. Transfer learning з некераваного навчання.
Візуалізація
t-SNE, UMAP для візуалізації високовимірних даних у 2D/3D. Дослідницький аналіз, розуміння структури даних.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Hash Function Avalanche Visualizer і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Hash Function Avalanche Visualizer