Begränsningar med k-means-klustring

Klusteranalys i Python

Shaumik Daityari

Business Analyst

Begränsningar med k-means-klustring

  • Hur hittar man rätt _K_ (antal kluster)?
  • Påverkan av seeds
  • Tenderar mot lika stora kluster
Klusteranalys i Python

Påverkan av seeds

Initiera ett slumpmässigt seed

from numpy import random
random.seed(12)

Seed: np.array(1000, 2000)

Klusterstorlekar: 29, 29, 43, 47, 52

 

Seed: np.array(1,2,3)

Klusterstorlekar: 26, 31, 40, 50, 53

Klusteranalys i Python

Påverkan av seeds: diagram

Seed: np.array(1000, 2000)

Seed: np.array(1,2,3)

Klusteranalys i Python

Likformiga kluster i k-means

Klusteranalys i Python

Likformiga kluster i k-means: en jämförelse

K-means-klustring med 3 kluster

Hierarkisk klustring med 3 kluster

Klusteranalys i Python

Avslutande tankar

  • Varje metod har sina för- och nackdelar
  • Ta hänsyn till datastorlek och mönster innan du väljer algoritm
  • Klustring är en utforskande fas i analysen
Klusteranalys i Python

Nu kör vi en övning!

Klusteranalys i Python

Preparing Video For Download...