Standaryzacja cech

Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Kevin Huo

Instructor

Dlaczego standaryzacja jest ważna

  • Standaryzacja: dostosowanie danych do założeń modeli
  • Niektóre cechy mogą mieć zbyt dużą wariancję i nieproporcjonalnie wpływać na modele
  • Przykład: pewne liczniki mają zbyt szeroki zakres wartości z powodu jednego spamera
  • Nie dotyczy zmiennych kategorycznych, takich jak site_id, app_id, device_id itp.
Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Normalizacja logarytmiczna

df.var()
click                   1.294270e-01
hour                    1.123316e-01
df.var().median()
0.7108583771671939
print(df['click'].var())
df['device_id_count'] = df[
  'device_id_count'].apply(
  lambda x: np.log(x))
print(df['click'].var())
249362570.10134825
15.628476003312514
Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Skalowanie danych

  • Skalowanie standardowe przekształca wszystkie cechy tak, aby miały średnią 0 i odchylenie standardowe 1

Przykład skalowania standardowego

  • Ogólnie zalecana praktyka w uczeniu maszynowym
Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Jak przeprowadzić skalowanie standardowe

  • Skalowanie można wykonać za pomocą StandardScaler() w następujący sposób:
scaler = StandardScaler()
X[numeric_cols] = scaler.fit_transform(X[numeric_cols])
dtype: float64
1    10.5 -> 0.85
2    32.3 -> 1.54
Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Czas na ćwiczenia!

Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Preparing Video For Download...