特徴量の標準化

PythonでMachine Learningを使ってCTRを予測する

Kevin Huo

Instructor

標準化が重要な理由

  • 標準化: モデルの前提に合うようにデータを整える
  • 一部の特徴量の分散が大きすぎると、モデルを不当に支配することがある
  • 例: スパムユーザー1人でカウント値の範囲が極端に広がる
  • site_idapp_iddevice_id などのカテゴリ変数には不要
PythonでMachine Learningを使ってCTRを予測する

対数正規化

df.var()
click                   1.294270e-01
hour                    1.123316e-01
df.var().median()
0.7108583771671939
print(df['click'].var())
df['device_id_count'] = df[
  'device_id_count'].apply(
  lambda x: np.log(x))
print(df['click'].var())
249362570.10134825
15.628476003312514
PythonでMachine Learningを使ってCTRを予測する

データのスケーリング

  • 標準スケーリングは平均0・標準偏差1に揃える

標準スケーリングの例

  • 多くの機械学習モデルで有効な実践
PythonでMachine Learningを使ってCTRを予測する

標準スケールの適用方法

  • StandardScaler() で次のように実行
scaler = StandardScaler()
X[numeric_cols] = scaler.fit_transform(X[numeric_cols])
dtype: float64
1    10.5 -> 0.85
2    32.3 -> 1.54
PythonでMachine Learningを使ってCTRを予測する

練習に進みましょう!

PythonでMachine Learningを使ってCTRを予測する

Preparing Video For Download...