Préparation des données pour l'analyse en grappes

Analyse de grappes en Python

Shaumik Daityari

Business Analyst

Pourquoi préparer les données pour le groupement ?

  • Variables avec des unités incomparables (dimensions du produit en cm, prix en $)
  • Variables de mêmes unités mais d'échelles et variances très différentes (dépenses en céréales, voyages)
  • Des données brutes peuvent biaiser le groupement
  • Les grappes peuvent dépendre fortement d'une seule variable
  • Solution : normaliser chaque variable
Analyse de grappes en Python

Normalisation des données

Normalisation : redimensionner les données pour obtenir un écart-type de 1

x_new = x / std_dev(x)

from scipy.cluster.vq import whiten
data = [5, 1, 3, 3, 2, 3, 3, 8, 1, 2, 2, 3, 5]
scaled_data = whiten(data)
print(scaled_data)
[2.73, 0.55, 1.64, 1.64, 1.09, 1.64, 1.64, 4.36, 0.55, 1.09, 1.09, 1.64, 2.73]
Analyse de grappes en Python

Illustration : normalisation des données

# Import plotting library
from matplotlib import pyplot as plt

# Initialize original, scaled data
plt.plot(data, 
         label="original")
plt.plot(scaled_data, 
         label="scaled")
# Show legend and display plot
plt.legend()
plt.show()

Analyse de grappes en Python

À suivre : quelques exercices pratiques

Analyse de grappes en Python

Preparing Video For Download...