Legătura în clustering și aspecte practice

Învățare nesupervizată în R

Hank Roark

Senior Data Scientist at Boeing

Legarea clusterelor în clustering ierarhic

  • Cum se determină distanța dintre clustere?
  • Patru metode pentru a determina care clustere sunt legate
    • Completă: similaritate pereche între toate observațiile din clusterul 1 și 2, folosind cea mai mare similaritate
    • Simplă: similar, dar folosind cea mai mică similaritate
    • Medie: similar, dar folosind media similarităților
    • Centroid: găsește centroidul fiecărui cluster și folosește similaritatea dintre cei doi centroizi
Învățare nesupervizată în R

Metode de legare: completă și medie

dendrograme complete și medii

Învățare nesupervizată în R

Metodă de legare: simplă

dendrogramă simplă

Învățare nesupervizată în R

Metodă de legare: centroid

dendrogramă centroid

Învățare nesupervizată în R

Legare în R

# Fitting hierarchical clustering models using different methods
hclust.complete <- hclust(d, method = "complete")
hclust.average <- hclust(d, method = "average")
hclust.single <- hclust(d, method = "single")
Învățare nesupervizată în R

Aspecte practice

  • Datele la scări diferite pot produce rezultate nedorite în clustering
  • Soluția este scalarea datelor astfel încât variabilele să aibă aceeași medie și deviație standard
    • Se scade media variabilei din toate observațiile
    • Se împarte fiecare variabilă la deviația sa standard
    • Variabilele normalizate au media zero și deviația standard unu
Învățare nesupervizată în R

Aspecte practice

# Check if scaling is necessary
colMeans(x)
-0.1337828  0.0594019
apply(x, 2, sd)
1.974376 2.112357
Învățare nesupervizată în R

Aspecte practice

# Produce new matrix with columns of mean of 0 and sd of 1
scaled_x <- scale(x)
colMeans(scaled_x)
2.775558e-17 3.330669e-17
apply(scaled_x, 2, sd)
1 1
Învățare nesupervizată în R

Să exersăm!

Învățare nesupervizată în R

Preparing Video For Download...