主成分分析回顾与后续步骤

R 中的无监督学习

Hank Roark

Senior Data Scientist at Boeing

到目前为止的回顾

  • 下载数据并完成建模准备
  • 探索性数据分析
  • 执行主成分分析(PCA)
R 中的无监督学习

后续步骤

  • 完成层次聚类
  • 完成 k-means 聚类
  • 结合 PCA 与聚类
  • 将层次聚类结果与诊断对比
  • 比较层次聚类与 k-means 结果
  • 将 PCA 用作聚类的预处理步骤
R 中的无监督学习

回顾:R 中的层次聚类

# Calculates similarity as Euclidean distance between observations
s <- dist(x)

# Returns hierarchical clustering model
hclust(s)
Call:
hclust(d = s)

Cluster method   : complete 
Distance         : euclidean 
Number of objects: 50 
R 中的无监督学习

回顾:R 中的 k-means

$$

# k-means algorithm with 5 centers, run 20 times
kmeans(x, centers = 5, nstart = 20)

$$

  • 每行一条观测,每列一个特征
  • k-means 含随机性
  • 多次运行以提高获得最优模型的概率
R 中的无监督学习

Let's practice!

R 中的无监督学习

Preparing Video For Download...