Begränsningar med hierarkisk klustring

Klusteranalys i Python

Shaumik Daityari

Business Analyst

Mäta hastighet vid hierarkisk klustring

  • Modulen timeit
  • Mät hastigheten för .linkage()-metoden
  • Använd slumpmässigt genererade punkter
  • Kör flera iterationer för att extrapolera
Klusteranalys i Python

Användning av modulen `timeit`

from scipy.cluster.hierarchy import linkage
import pandas as pd
import random, timeit

points = 100 df = pd.DataFrame({'x': random.sample(range(0, points), points), 'y': random.sample(range(0, points), points)})
%timeit linkage(df[['x', 'y']], method = 'ward', metric = 'euclidean')
1.02 ms ± 133 µs per loop (mean ± std. dev. of 7 runs, 1000 loops each)
Klusteranalys i Python

Jämförelse av körtid för linkage-metoden

  • Körtiden ökar med antalet datapunkter
  • Kvadratisk ökning av körtiden
  • Inte lämpligt för stora datamängder

Klusteranalys i Python

Nu kör vi en övning!

Klusteranalys i Python

Preparing Video For Download...