Unsupervised Learning

Unsupervised Learning in Python

Benjamin Wilson

Director of Research at lateral.io

Apprentissage non supervisé

  • L'apprentissage non supervisé trouve des motifs dans les données
  • P. ex., regrouper des clientes et clients selon leurs achats
  • Compresser les données à partir des habitudes d'achat (réduction de dimension)
Unsupervised Learning in Python

Apprentissage supervisé vs non supervisé

  • L'apprentissage supervisé trouve des motifs pour une tâche de prédiction
  • P. ex., classer des tumeurs comme bénignes ou cancéreuses (étiquettes)
  • L'apprentissage non supervisé trouve des motifs dans les données
  • ... mais sans tâche de prédiction précise
Unsupervised Learning in Python

Jeu de données Iris

  • Mesures de plusieurs plants d'iris
  • Trois espèces d'iris :
    • setosa
    • versicolor
    • virginica
  • Longueur/largeur des pétales, longueur/largeur des sépales (les caractéristiques du jeu de données)

Iris

1 https://scikit-learn.org/stable/modules/generated/sklearn.datasets.load_iris.html
Unsupervised Learning in Python

Tableaux, caractéristiques et échantillons

  • Tableau NumPy 2D
  • Les colonnes sont des mesures (les caractéristiques)
  • Les lignes représentent des plants d'iris (les échantillons)
Unsupervised Learning in Python

Les données Iris ont 4 dimensions

  • Les échantillons d'iris sont des points dans un espace à 4 dimensions
  • Dimension = nombre de caractéristiques
  • Dimension trop élevée pour visualiser !
  • ... mais l'apprentissage non supervisé éclaire les données
Unsupervised Learning in Python

Regroupement k-means

  • Trouve des grappes d'échantillons
  • Nombre de grappes à préciser
  • Implémenté dans sklearn (« scikit-learn »)
Unsupervised Learning in Python
print(samples)
[[ 5.   3.3  1.4  0.2]
 [ 5.   3.5  1.3  0.3]
 ...
 [ 7.2  3.2  6.   1.8]]
from sklearn.cluster import KMeans

model = KMeans(n_clusters=3)
model.fit(samples)
KMeans(n_clusters=3)
labels = model.predict(samples)

print(labels)
[0 0 1 1 0 1 2 1 0 1 ...]
Unsupervised Learning in Python

Étiquettes de grappe pour de nouveaux échantillons

  • De nouveaux échantillons peuvent être rattachés aux grappes existantes
  • k-means retient la moyenne de chaque grappe (les « centroïdes »)
  • Trouve le centroïde le plus proche de chaque nouvel échantillon
Unsupervised Learning in Python

Étiquettes de grappe pour de nouveaux échantillons

print(new_samples)
[[ 5.7  4.4  1.5  0.4]
 [ 6.5  3.   5.5  1.8]
 [ 5.8  2.7  5.1  1.9]]
new_labels = model.predict(new_samples)

print(new_labels)
[0 2 1]
Unsupervised Learning in Python

Nuages de points

  • Nuage de points : longueur du sépale vs longueur du pétale
  • Chaque point représente un échantillon d'iris
  • Colorer les points selon les étiquettes de grappe
  • PyPlot (matplotlib.pyplot)

Nuage de points

Unsupervised Learning in Python

Nuages de points

import matplotlib.pyplot as plt

xs = samples[:,0] ys = samples[:,2]
plt.scatter(xs, ys, c=labels)
plt.show()
Unsupervised Learning in Python

Passons à la pratique !

Unsupervised Learning in Python

Preparing Video For Download...