Pythonで学ぶ木ベースのMachine Learning
Elie Kawerk
Data Scientist

$f$を最もよく近似するモデル$\hat{f}$を見つける: $\hat{f} \approx f$
$\hat{f}$はロジスティック回帰、決定木、ニューラルネットワークなどが考えられる。
ノイズをできる限り除去する。
最終目標: $\hat{f}$は未知のデータセットに対して低い予測誤差を達成すること。
過学習:
$\hat{f}(x)$が訓練セットのノイズに適合してしまう。
未学習:
$\hat{f}$が$f$を近似するのに十分な柔軟性を持たない。


$\hat{f}$の汎化誤差: $\hat{f}$は未知のデータに対して汎化できるか?
以下のように分解できます:
$\hat{f}$の汎化誤差 $= bias^2 + variance + \text{irreducible error}$


モデルの複雑度: $\hat{f}$の柔軟性を決定する。
例: 最大木深度、葉ノードの最小サンプル数、...


Pythonで学ぶ木ベースのMachine Learning