Einführung in k-means-Clustering

Unüberwachtes Lernen in R

Hank Roark

Senior Data Scientist at Boeing

k-means-Clustering-Algorithmus

  • Erster von zwei Clustering-Algorithmen in diesem Kurs
  • Teilt Beobachtungen in eine vorgegebene Anzahl von Clustern

zwei Gruppen

Unüberwachtes Lernen in R

k-means in R

# k-means algorithm with 5 centers, run 20 times
kmeans(x, centers = 5, nstart = 20)
  • Eine Beobachtung pro Zeile, ein Merkmal pro Spalte
  • k-means hat eine Zufallskomponente
  • Algorithmus mehrfach ausführen, um die Chance auf das beste Modell zu erhöhen
Unüberwachtes Lernen in R

Erste Übungen

  • Erste Übung nutzt synthetische Daten
  • Synthetische Daten aus 3 Untergruppen erzeugt
  • Die beste Anzahl an Untergruppen für k-means wählen
  • Später im Kapitel ein Beispiel mit spaßigeren Daten
Unüberwachtes Lernen in R

Lass uns üben!

Unüberwachtes Lernen in R

Preparing Video For Download...