Recapitulare PCA și pași următori

Învățare nesupervizată în R

Hank Roark

Senior Data Scientist at Boeing

Recapitulare

  • Descărcarea datelor și pregătirea pentru modelare
  • Analiza exploratorie a datelor
  • Analiza componentelor principale
Învățare nesupervizată în R

Pași următori

  • Clustering ierarhic
  • Clustering k-means
  • Combinarea PCA cu clustering
  • Compararea clustering-ului ierarhic cu diagnosticul
  • Compararea rezultatelor ierarhic vs. k-means
  • PCA ca etapă de preprocesare pentru clustering
Învățare nesupervizată în R

Recapitulare: clustering ierarhic în R

# Calculates similarity as Euclidean distance between observations
s <- dist(x)

# Returns hierarchical clustering model
hclust(s)
Call:
hclust(d = s)

Cluster method   : complete 
Distance         : euclidean 
Number of objects: 50 
Învățare nesupervizată în R

Recapitulare: k-means în R

$$

# k-means algorithm with 5 centers, run 20 times
kmeans(x, centers = 5, nstart = 20)

$$

  • O observație per rând, o variabilă per coloană
  • k-means are o componentă aleatoare
  • Rulați algoritmul de mai multe ori pentru cel mai bun model
Învățare nesupervizată în R

Să exersăm!

Învățare nesupervizată în R

Preparing Video For Download...