Wie k-means funktioniert und Praxisaspekte

Unüberwachtes Lernen in R

Hank Roark

Senior Data Scientist at Boeing

Ziele

  • Erkläre die visuelle Umsetzung des k-means-Algorithmus
  • Modellauswahl: Anzahl der Cluster bestimmen
Unüberwachtes Lernen in R

Beobachtungen

Unüberwachtes Lernen in R

zufällige Clusterzuweisung

Unüberwachtes Lernen in R

Clusterzentren berechnet

Unüberwachtes Lernen in R

nach Neu­zuweisung

Unüberwachtes Lernen in R

Iteration 2

Unüberwachtes Lernen in R

Iteration 3

Unüberwachtes Lernen in R

Iteration 4

Unüberwachtes Lernen in R

Iteration 5

Unüberwachtes Lernen in R

Modellauswahl

  • Denk dran: k-means hat eine Zufallskomponente
  • Bestes Ergebnis: minimale Gesamt‑Streuungs­summe innerhalb der Cluster (within-cluster sum of squares)
    • Für jedes Cluster
      • Für jede Beobachtung im Cluster
        • Quadratabstand von Beobachtung zum Clusterzentrum berechnen
      • Alle aufsummieren
Unüberwachtes Lernen in R

Modellauswahl

# k-means algorithm with 5 centers, run 20 times
kmeans(x, centers = 5, nstart = 20)
  • Mehrfaches Ausführen hilft, das globale Minimum der within-cluster sum of squares zu finden
  • Ein Beispiel siehst du in den Übungen
Unüberwachtes Lernen in R

k-means mehrfach ausführen

Unüberwachtes Lernen in R

Beste Clusteranzahl bestimmen

  • Ausprobieren ist nicht die beste Methode

beste Clusteranzahl mit einem Elbow-Plot bestimmen

Unüberwachtes Lernen in R

Beste Clusteranzahl bestimmen

  • Ausprobieren ist nicht die beste Methode

beste Clusteranzahl mit einem Elbow-Plot bestimmen

Unüberwachtes Lernen in R

Lass uns üben!

Unüberwachtes Lernen in R

Preparing Video For Download...