Standaryzacja

Preprocessing w uczeniu maszynowym w Pythonie

James Chapman

Curriculum Manager, DataCamp

Czym jest standaryzacja?

 

Standaryzacja: przekształcenie danych ciągłych do rozkładu normalnego

  • Modele scikit-learn zakładają normalny rozkład danych
  • Dane nienormalne w zbiorze treningowym mogą wprowadzać odchylenie
  • W tym kursie: normalizacja logarytmiczna i skalowanie cech
  • Stosowane do ciągłych danych numerycznych
Preprocessing w uczeniu maszynowym w Pythonie

Kiedy standaryzować: odległości liniowe

  • Model w przestrzeni liniowej

 

Przykłady:

  • k-Nearest Neighbors (kNN)
  • Regresja liniowa
  • Klasteryzacja K-Means

Przykład kNN.

Preprocessing w uczeniu maszynowym w Pythonie

Kiedy standaryzować: wysoka wariancja

  • Model w przestrzeni liniowej

 

Przykłady:

  • k-Nearest Neighbors (kNN)
  • Regresja liniowa
  • Klasteryzacja K-Means

 

  • Cechy zbioru mają wysoką wariancję

Przykład kNN.

Preprocessing w uczeniu maszynowym w Pythonie

Kiedy standaryzować: różne skale

 

  • Cechy są w różnych skalach

 

Przykład:

  • Przewidywanie cen domów na podstawie liczby sypialni i ceny ostatniej sprzedaży

 

  • Założenia liniowości
Preprocessing w uczeniu maszynowym w Pythonie

Czas na ćwiczenia!

Preprocessing w uczeniu maszynowym w Pythonie

Preparing Video For Download...