Normalisation

Prétraitement pour le Machine Learning en Python

James Chapman

Curriculum Manager, DataCamp

Qu'est-ce que la normalisation ?

 

Normalisation : transformer des données continues pour qu'elles paraissent normalement distribuées

  • Les modèles scikit-learn supposent des données normales
  • Des données d'entraînement non normales peuvent introduire un biais
  • Normalisation logarithmique et mise à l'échelle dans ce cours
  • S'applique aux données numériques continues
Prétraitement pour le Machine Learning en Python

Quand normaliser : distances linéaires

  • Modéliser dans un espace linéaire

 

Exemples :

  • k-Nearest Neighbors (kNN)
  • Régression linéaire
  • Regroupement K-Means

Un exemple de kNN.

Prétraitement pour le Machine Learning en Python

Quand normaliser : forte variance

  • Modéliser dans un espace linéaire

 

Exemples :

  • k-Nearest Neighbors (kNN)
  • Régression linéaire
  • Regroupement K-Means

 

  • Les variables du jeu de données ont une forte variance

Un exemple de kNN.

Prétraitement pour le Machine Learning en Python

Quand normaliser : échelles différentes

 

  • Caractéristiques sur des échelles différentes

 

Exemple :

  • Prédire le prix des maisons avec le nb de chambres et le dernier prix de vente

 

  • Hypothèses de linéarité
Prétraitement pour le Machine Learning en Python

Passons à la pratique !

Prétraitement pour le Machine Learning en Python

Preparing Video For Download...