勾配ブースティング

Rで学ぶTree-Based ModelsによるMachine Learning

Sandro Raabe

Data Scientist

復習: ブースティング

  • 弱学習器(例: 1回だけ分割する決定木)を用い、ランダムよりわずかに良い性能を出す
  • それら弱学習器を加算し、正解予測を相殺
  • 各ステップで残る難例を重点的に学習

 

  • AdaBoost: 最初に普及したブースティング手法
  • 勾配ブースティング: AdaBoost の改良版
Rで学ぶTree-Based ModelsによるMachine Learning

比較

Adaboost
  • 弱学習器として決定スタンプを使用
  • 観測に重みを付与:
    • 難しい観測に高い重み
    • 正解予測に低い重み
勾配ブースティング
  • 小さな決定木を弱学習器として使用
  • 重みの代わりに損失関数を使用
  • 勾配降下法で損失を最適化
Rで学ぶTree-Based ModelsによるMachine Learning

ブースティングの長所と短所

 

長所

  • 最高水準の性能を持つ機械学習モデルの一つ
  • 不均衡データに強い

 

短所

  • 過学習しやすい
  • 学習が遅い場合がある(ハイパーパラメータの学習率に依存)
  • 調整すべきハイパーパラメータが多い
Rで学ぶTree-Based ModelsによるMachine Learning

勾配ブースティングのハイパーパラメータ

単純な決定木で既知
  • min_n: さらなる分割に必要なノード内の最小データ数
  • tree_depth: 木の最大深さ/分割回数
ランダムフォレスト・バギングで既知:
  • sample_size: 学習に投入するデータ量
  • trees: アンサンブル内の木の本数
Rで学ぶTree-Based ModelsによるMachine Learning

勾配ブースティングのハイパーパラメータ

ランダムフォレストで既知:
  • mtry: 各分割でランダム抽出する予測子の数
ブースティング特有:
  • learn_rate: 反復ごとに適応する速さ(学習率)
  • loss_reduction: さらに分割するために必要な損失の減少量
  • stop_iter: 改善がない状態で停止するまでの反復回数
Rで学ぶTree-Based ModelsによるMachine Learning

Passons à la pratique !

Rで学ぶTree-Based ModelsによるMachine Learning

Preparing Video For Download...