Інтерактивна симуляція алгоритмів кластеризації для групування даних
Ітеративний алгоритм з центроїдами
Щільність-базований алгоритм
Дендрограма та дерево кластерів
Модель суміші гаусових розподілів
K-Means ітеративно призначає точки до найближчого центроїда та перераховує центроїди як середнє значення всіх точок у кластері. Алгоритм збігається до локального мінімуму.
DBSCAN групує точки на основі щільності. Точки в густих областях утворюють кластери, а точки в рідких областях класифікуються як шум. Алгоритм не потребує заздалегідь заданої кількості кластерів.
Ієрархічна кластеризація будує дерево кластерів, де кожен вузол представляє кластер. Алгоритм може працювати знизу вгору (агломеративний) або зверху вниз (дівізійний).
Silhouette score вимірює наскільки добре точка відповідає своєму кластеру порівняно з іншими кластерами. Inertia показує суму квадратів відстаней до центроїдів.
Кластеризація - це задача навчання без учителя, де алгоритм групує схожі об'єкти в кластери. Це допомагає виявити приховані патерни та структуру в даних.
Метод ліктя (Elbow method) аналізує зміну inertia при різних значеннях K. Silhouette analysis також допомагає вибрати оптимальну кількість кластерів.
DBSCAN краще підходить для даних з нерегулярними формами кластерів, коли кількість кластерів невідома, або коли є шум у даних. K-Means працює краще з сферичними кластерами.
Silhouette score вимірює наскільки добре об'єкт відповідає своєму кластеру. Значення від -1 до 1, де 1 означає ідеальну кластеризацію, а -1 - погану.
Кластеризація використовується для сегментації клієнтів, аналізу зображень, виявлення аномалій, групування документів, біоінформатики та багатьох інших завдань.