Що таке K-means кластеризація?
K-means - це один з найпопулярніших алгоритмів кластеризації в машинному навчанні. Він автоматично групує схожі точки даних у кластери, знаходячи центри цих груп.
Як працює алгоритм:
- 1. Випадково розміщуємо K центрів кластерів
- 2. Кожній точці призначаємо найближчий центр
- 3. Перераховуємо центри як середнє всіх точок кластера
- 4. Повторюємо кроки 2-3 до збіжності
Застосування:
- • Сегментація клієнтів
- • Аналіз зображень
- • Групування документів
- • Виявлення аномалій
3
150
5
Візуалізація кластеризації
Статистика
Ітерація:
0
Внутрішньокластерна відстань:
0.00
Міжкластерна відстань:
0.00
Коефіцієнт силуету:
0.00
Статус:
Готово
Графік збіжності
Часті запитання
Використовують метод ліктя (Elbow method), аналіз силуету або інформаційні критерії (AIC, BIC).
Через випадкову ініціалізацію центрів. Рішення: запускати алгоритм кілька разів з різними початковими центрами.
Чутливий до викидів, працює тільки з числовими даними, припускає сферичні кластери однакового розміру.
Коефіцієнт силуету, індекс Калінського-Харабаза, або зовнішні метрики якщо є еталонні класи.
Так, після векторизації тексту (TF-IDF, Word2Vec, BERT embeddings).