Standardizare

Preprocesare pentru Machine Learning în Python

James Chapman

Curriculum Manager, DataCamp

Ce este standardizarea?

 

Standardizare: transformarea datelor continue pentru a urma o distribuție normală

  • Modelele scikit-learn presupun date normal distribuite
  • Datele de antrenare nenormale pot introduce bias
  • Normalizarea logaritmică și scalarea caracteristicilor în acest curs
  • Aplicat datelor numerice continue
Preprocesare pentru Machine Learning în Python

Când se standardizează: distanțe liniare

  • Model în spațiu liniar

 

Exemple:

  • k-Nearest Neighbors (kNN)
  • Regresie liniară
  • K-Means Clustering

Exemplu knn.

Preprocesare pentru Machine Learning în Python

Când se standardizează: variație ridicată

  • Model în spațiu liniar

 

Exemple:

  • k-Nearest Neighbors (kNN)
  • Regresie liniară
  • K-Means Clustering

 

  • Caracteristicile setului de date au variație ridicată

Exemplu knn.

Preprocesare pentru Machine Learning în Python

Când se standardizează: scale diferite

 

  • Caracteristicile sunt pe scale diferite

 

Exemplu:

  • Predicția prețurilor imobiliare folosind nr. de dormitoare și ultimul preț de vânzare

 

  • Ipoteze de liniaritate
Preprocesare pentru Machine Learning în Python

Să exersăm!

Preprocesare pentru Machine Learning în Python

Preparing Video For Download...