Standardizace příznaků

Předpovídání CTR pomocí Machine Learning v Pythonu

Kevin Huo

Instructor

Proč je standardizace důležitá

  • Standardizace: zajišťuje, že data splňují předpoklady modelů
  • Některé příznaky mohou mít příliš vysoký rozptyl a neúměrně ovlivňovat modely
  • Příklad: určité počty mají příliš velký rozsah hodnot kvůli jednomu spamovému uživateli
  • Netýká se kategorických proměnných, jako jsou site_id, app_id, device_id apod.
Předpovídání CTR pomocí Machine Learning v Pythonu

Logaritmická normalizace

df.var()
click                   1.294270e-01
hour                    1.123316e-01
df.var().median()
0.7108583771671939
print(df['click'].var())
df['device_id_count'] = df[
  'device_id_count'].apply(
  lambda x: np.log(x))
print(df['click'].var())
249362570.10134825
15.628476003312514
Předpovídání CTR pomocí Machine Learning v Pythonu

Škálování dat

  • Standardní škálování převede všechny příznaky na střední hodnotu 0 a směrodatnou odchylku 1

Příklad standardního škálování

  • Obecně doporučený postup pro modely strojového učení
Předpovídání CTR pomocí Machine Learning v Pythonu

Jak provést standardní škálování dat

  • Škálování lze provést pomocí StandardScaler() takto:
scaler = StandardScaler()
X[numeric_cols] = scaler.fit_transform(X[numeric_cols])
dtype: float64
1    10.5 -> 0.85
2    32.3 -> 1.54
Předpovídání CTR pomocí Machine Learning v Pythonu

Pojďme cvičit!

Předpovídání CTR pomocí Machine Learning v Pythonu

Preparing Video For Download...