Standardisering

Förbehandling för maskininlärning i Python

James Chapman

Curriculum Manager, DataCamp

Vad är standardisering?

 

Standardisering: omvandlar kontinuerliga data till en normalfördelning

  • scikit-learn-modeller förutsätter normalfördelade data
  • Icke-normal träningsdata kan introducera bias
  • Lognormalisering och skalning av särdrag i den här kursen
  • Tillämpas på kontinuerliga numeriska data
Förbehandling för maskininlärning i Python

När ska man standardisera: linjära avstånd

  • Modell i linjärt rum

 

Exempel:

  • k-Nearest Neighbors (kNN)
  • Linjär regression
  • K-Means-klustring

Ett kNN-exempel.

Förbehandling för maskininlärning i Python

När ska man standardisera: hög varians

  • Modell i linjärt rum

 

Exempel:

  • k-Nearest Neighbors (kNN)
  • Linjär regression
  • K-Means-klustring

 

  • Datamängdens särdrag har hög varians

Ett kNN-exempel.

Förbehandling för maskininlärning i Python

När ska man standardisera: olika skalor

 

  • Särdrag har olika skalor

 

Exempel:

  • Förutsäga huspriser med antal sovrum och senaste försäljningspris

 

  • Linjäritetsantaganden
Förbehandling för maskininlärning i Python

Nu kör vi en övning!

Förbehandling för maskininlärning i Python

Preparing Video For Download...