Länkning och praktiska aspekter vid klustring

Oövervakad inlärning i R

Hank Roark

Senior Data Scientist at Boeing

Länkning av kluster vid hierarkisk klustring

  • Hur bestäms avståndet mellan kluster?
  • Fyra metoder för att avgöra vilka kluster som ska länkas
    • Complete: parvisa likheter mellan alla observationer i kluster 1 och kluster 2 – använder den största likheten
    • Single: samma som ovan men använder den minsta likheten
    • Average: samma som ovan men använder genomsnittet av likheterna
    • Centroid: beräknar centroid för kluster 1 och kluster 2, och använder likheten mellan de två centroiderna
Oövervakad inlärning i R

Länkningsmetoder: complete och average

dendogram för complete och average

Oövervakad inlärning i R

Länkningsmetod: single

dendogram för single

Oövervakad inlärning i R

Länkningsmetod: centroid

dendogram för centroid

Oövervakad inlärning i R

Länkning i R

# Fitting hierarchical clustering models using different methods
hclust.complete <- hclust(d, method = "complete")
hclust.average <- hclust(d, method = "average")
hclust.single <- hclust(d, method = "single")
Oövervakad inlärning i R

Praktiska aspekter

  • Data på olika skalor kan ge oönskade resultat vid klustring
  • Lösningen är att skala data så att alla särdrag får samma medelvärde och standardavvikelse
    • Subtrahera medelvärdet för ett särdrag från alla observationer
    • Dividera varje särdrag med dess standardavvikelse
    • Normaliserade särdrag får medelvärdet noll och standardavvikelsen ett
Oövervakad inlärning i R

Praktiska aspekter

# Check if scaling is necessary
colMeans(x)
-0.1337828  0.0594019
apply(x, 2, sd)
1.974376 2.112357
Oövervakad inlärning i R

Praktiska aspekter

# Produce new matrix with columns of mean of 0 and sd of 1
scaled_x <- scale(x)
colMeans(scaled_x)
2.775558e-17 3.330669e-17
apply(scaled_x, 2, sd)
1 1
Oövervakad inlärning i R

Nu kör vi en övning!

Oövervakad inlärning i R

Preparing Video For Download...