Omezení shlukování k-means

Cluster Analysis in Python

Shaumik Daityari

Business Analyst

Omezení shlukování k-means

  • Jak určit správné _K_ (počet shluků)?
  • Vliv počátečních hodnot (seeds)
  • Sklon k vytváření stejně velkých shluků
Cluster Analysis in Python

Vliv seedů

Inicializace náhodného seedu

from numpy import random
random.seed(12)

Seed: np.array(1000, 2000)

Velikosti shluků: 29, 29, 43, 47, 52

 

Seed: np.array(1,2,3)

Velikosti shluků: 26, 31, 40, 50, 53

Cluster Analysis in Python

Vliv seedů: grafy

Seed: np.array(1000, 2000)

Seed: np.array(1,2,3)

Cluster Analysis in Python

Stejnoměrné shluky v k-means

Cluster Analysis in Python

Stejnoměrné shluky v k-means: srovnání

Shlukování k-means se 3 shluky

Hierarchické shlukování se 3 shluky

Cluster Analysis in Python

Závěrečné poznámky

  • Každá metoda má své výhody i nevýhody
  • Před výběrem algoritmu zvažte velikost a strukturu dat
  • Shlukování je průzkumnou fází analýzy
Cluster Analysis in Python

Následují cvičení

Cluster Analysis in Python

Preparing Video For Download...