Liên kết phân cụm và vấn đề thực tiễn

Học không giám sát với R

Hank Roark

Senior Data Scientist at Boeing

Liên kết cụm trong phân cụm phân cấp

  • Khoảng cách giữa cụm được xác định thế nào? Quy tắc?
  • Bốn cách quyết định cụm nào sẽ liên kết
    • Complete: xét độ tương tự từng cặp giữa mọi quan sát của cụm 1 và 2, dùng giá trị lớn nhất
    • Single: như trên nhưng dùng giá trị nhỏ nhất
    • Average: như trên nhưng dùng giá trị trung bình
    • Centroid: tìm trọng tâm của cụm 1 và 2, dùng độ tương tự giữa hai trọng tâm
Học không giám sát với R

Phương pháp liên kết: complete và average

sơ đồ cây: complete và average

Học không giám sát với R

Phương pháp liên kết: single

sơ đồ cây: single

Học không giám sát với R

Phương pháp liên kết: centroid

sơ đồ cây: centroid

Học không giám sát với R

Liên kết trong R

# Khớp mô hình phân cụm phân cấp với các phương pháp khác nhau
hclust.complete <- hclust(d, method = "complete")
hclust.average <- hclust(d, method = "average")
hclust.single <- hclust(d, method = "single")
Học không giám sát với R

Vấn đề thực tiễn

  • Dữ liệu ở các thang đo khác nhau có thể gây kết quả phân cụm không mong muốn
  • Giải pháp: chuẩn hóa để các đặc trưng có cùng trung bình và độ lệch chuẩn
    • Trừ trung bình của đặc trưng khỏi mọi quan sát
    • Chia mỗi đặc trưng cho độ lệch chuẩn của chính nó
    • Đặc trưng đã chuẩn hóa có trung bình 0 và độ lệch chuẩn 1
Học không giám sát với R

Vấn đề thực tiễn

# Kiểm tra có cần chuẩn hóa không
colMeans(x)
-0.1337828  0.0594019
apply(x, 2, sd)
1.974376 2.112357
Học không giám sát với R

Vấn đề thực tiễn

# Tạo ma trận mới với cột có mean = 0 và sd = 1
scaled_x <- scale(x)
colMeans(scaled_x)
2.775558e-17 3.330669e-17
apply(scaled_x, 2, sd)
1 1
Học không giám sát với R

Ayo berlatih!

Học không giám sát với R

Preparing Video For Download...