標準化

Pythonで学ぶMachine Learningの前処理

James Chapman

Curriculum Manager, DataCamp

標準化とは?

 

標準化: _連続データを正規分布_に従うよう変換する

  • scikit-learn のモデルは正規分布データを前提とする
  • 非正規の訓練データはバイアスを生じさせる可能性がある
  • 本コースでは対数正規化と特徴量のスケーリングを扱う
  • 連続数値データに適用
Pythonで学ぶMachine Learningの前処理

標準化が必要な場合:線形距離

  • _線形_空間でモデル化

 

例:

  • k近傍法(kNN)
  • 線形回帰
  • K-Meansクラスタリング

kNNの例。

Pythonで学ぶMachine Learningの前処理

標準化が必要な場合:高い分散

  • _線形_空間でモデル化

 

例:

  • k近傍法(kNN)
  • 線形回帰
  • K-Meansクラスタリング

 

  • データセットの特徴量の分散が大きい

kNNの例。

Pythonで学ぶMachine Learningの前処理

標準化が必要な場合:スケールの違い

 

  • 特徴量のスケールが異なる

 

例:

  • 寝室数最終売却価格を用いた住宅価格予測

 

  • 線形性の前提
Pythonで学ぶMachine Learningの前処理

練習しましょう!

Pythonで学ぶMachine Learningの前処理

Preparing Video For Download...