总结与回顾

R 中的无监督学习

Hank Roark

Senior Data Scientist at Boeing

案例研究总结

  • 使用无监督学习的完整数据分析流程
  • 创新建模方法
  • 能应对真实问题
R 中的无监督学习

聚类类型

k-means 与树状图

R 中的无监督学习

降维

PCA 投影

R 中的无监督学习

模型选择

# 初始化组内平方和误差:wss
wss <- 0

# 遍历1到15个聚类数
for (i in 1:15) {
  # 拟合模型:km.out
  km.out <- kmeans(pokemon, centers = i, nstart = 20, iter.max = 50)
  # 保存组内平方和
  wss[i] <- km.out$tot.withinss
}

# 绘制碎石图
plot(1:15, wss, type = "b", 
     xlab = "Number of Clusters", 
     ylab = "Within groups sum of squares")
R 中的无监督学习

解读 PCA 结果

双标图与碎石图

R 中的无监督学习

数据缩放的重要性

比较缩放与未缩放的特征重要性

R 中的无监督学习

课程回顾

pr.iris <- prcomp(x = iris[-5],
                  scale = FALSE,
                  center = TRUE)
summary(pr.iris)
主成分的重要性:
                          PC1     PC2    PC3     PC4
标准差                 2.0563 0.49262 0.2797 0.15439
方差占比               0.9246 0.05307 0.0171 0.00521
累计占比               0.9246 0.97769 0.9948 1.00000
R 中的无监督学习

树状图

树状图

R 中的无监督学习

各算法的优缺点

不同聚类结果

R 中的无监督学习

课程回顾

# 对主成分1和3重复作图
plot(wisc.pr$x[, c(1, 3)], col = (diagnosis + 1), 
     xlab = "PC1", ylab = "PC3")

主成分

R 中的无监督学习

提升技能!

R 中的无监督学习

Preparing Video For Download...