Cluster-Verknüpfung und Praxis

Unüberwachtes Lernen in R

Hank Roark

Senior Data Scientist at Boeing

Cluster verknüpfen in der hierarchischen Clusteranalyse

  • Wie wird die Distanz zwischen Clustern bestimmt? Regeln?
  • Vier Methoden, um zu entscheiden, welche Cluster verknüpft werden
    • Complete: paarweise Ähnlichkeit aller Beobachtungen in Cluster 1 und 2; nutzt die größte Ähnlichkeit
    • Single: wie oben, nutzt die kleinste Ähnlichkeit
    • Average: wie oben, nutzt den Durchschnitt der Ähnlichkeiten
    • Centroid: findet den Schwerpunkt von Cluster 1 und 2 und nutzt die Ähnlichkeit der beiden Schwerpunkte
Unüberwachtes Lernen in R

Verknüpfungsmethoden: Complete und Average

Dendrogramme: Complete und Average

Unüberwachtes Lernen in R

Verknüpfungsmethode: Single

Dendrogramm: Single

Unüberwachtes Lernen in R

Verknüpfungsmethode: Centroid

Dendrogramm: Centroid

Unüberwachtes Lernen in R

Verknüpfung in R

# Hierarchische Cluster-Modelle mit verschiedenen Methoden fitten
hclust.complete <- hclust(d, method = "complete")
hclust.average <- hclust(d, method = "average")
hclust.single <- hclust(d, method = "single")
Unüberwachtes Lernen in R

Praktisches

  • Daten auf unterschiedlichen Skalen können zu unerwünschten Clustering-Ergebnissen führen
  • Lösung: Daten skalieren, sodass Features gleichen Mittelwert und gleiche Standardabweichung haben
    • Mittelwert eines Features von allen Beobachtungen abziehen
    • Jedes Feature durch seine Standardabweichung teilen
    • Normalisierte Features haben Mittelwert null und Standardabweichung eins
Unüberwachtes Lernen in R

Praktisches

# Prüfen, ob Skalierung nötig ist
colMeans(x)
-0.1337828  0.0594019
apply(x, 2, sd)
1.974376 2.112357
Unüberwachtes Lernen in R

Praktisches

# Neue Matrix mit Spalten: Mittelwert 0, SD 1 erzeugen
scaled_x <- scale(x)
colMeans(scaled_x)
2.775558e-17 3.330669e-17
apply(scaled_x, 2, sd)
1 1
Unüberwachtes Lernen in R

Lass uns üben!

Unüberwachtes Lernen in R

Preparing Video For Download...