Standardisering av särdrag

Förutsäga CTR med maskininlärning i Python

Kevin Huo

Instructor

Varför standardisering är viktigt

  • Standardisering: se till att dina data uppfyller modellernas antaganden
  • Vissa särdrag kan ha för hög varians och dominera modellen orättvist
  • Exempel: ett antal kan ha alltför stort värdeintervall på grund av en enda skräppostanvändare
  • Gäller inte kategoriska variabler som site_id, app_id, device_id osv.
Förutsäga CTR med maskininlärning i Python

Lognormalisering

df.var()
click                   1.294270e-01
hour                    1.123316e-01
df.var().median()
0.7108583771671939
print(df['click'].var())
df['device_id_count'] = df[
  'device_id_count'].apply(
  lambda x: np.log(x))
print(df['click'].var())
249362570.10134825
15.628476003312514
Förutsäga CTR med maskininlärning i Python

Skalning av data

  • Standardskalning omvandlar alla särdrag till medelvärde 0 och standardavvikelse 1

Exempel på standardskalning

  • Generellt god praxis för maskininlärningsmodeller
Förutsäga CTR med maskininlärning i Python

Så här standardskalar du data

  • Skalning kan göras med StandardScaler() enligt följande:
scaler = StandardScaler()
X[numeric_cols] = scaler.fit_transform(X[numeric_cols])
dtype: float64
1    10.5 -> 0.85
2    32.3 -> 1.54
Förutsäga CTR med maskininlärning i Python

Nu kör vi en övning!

Förutsäga CTR med maskininlärning i Python

Preparing Video For Download...