Обмеження кластеризації k-means

Кластерний аналіз у Python

Shaumik Daityari

Business Analyst

Обмеження кластеризації k-means

  • Як вибрати правильне _K_ (кількість кластерів)?
  • Вплив початкових зерен (seed)
  • Схильність до кластерів однакового розміру
Кластерний аналіз у Python

Вплив зерен (seed)

Ініціалізуйте випадкове зерно

from numpy import random
random.seed(12)

Зерно: np.array(1000, 2000)

Розміри кластерів: 29, 29, 43, 47, 52

 

Зерно: np.array(1,2,3)

Розміри кластерів: 26, 31, 40, 50, 53

Кластерний аналіз у Python

Вплив зерен: графіки

Зерно: np.array(1000, 2000)

Зерно: np.array(1,2,3)

Кластерний аналіз у Python

Однакові кластери в k-means

Кластерний аналіз у Python

Однакові кластери в k-means: порівняння

Кластеризація k-means із 3 кластерами

Ієрархічна кластеризація із 3 кластерами

Кластерний аналіз у Python

Підсумки

  • У кожного методу є переваги й недоліки
  • Перш ніж обрати алгоритм, врахуйте розмір і патерни даних
  • Кластеризація — це розвідувальний етап аналізу
Кластерний аналіз у Python

Далі: вправи

Кластерний аналіз у Python

Preparing Video For Download...