Python으로 배우는 트리 기반 Machine Learning
Elie Kawerk
Data Scientist

$f$를 가장 잘 근사하는 모델 $\hat{f}$ 찾기: $\hat{f} \approx f$
$\hat{f}$는 로지스틱 회귀, 결정 트리, 신경망 등이 될 수 있음.
잡음을 최대한 제거합니다.
최종 목표: $\hat{f}$가 새로운 데이터셋에서 낮은 예측 오차를 달성해야 합니다.
과적합(Overfitting):
$\hat{f}(x)$가 훈련 세트의 잡음에 맞춰집니다.
과소적합(Underfitting):
$\hat{f}$가 $f$를 근사하기에 충분히 유연하지 않습니다.


$\hat{f}$의 일반화 오차: $\hat{f}$는 새로운 데이터에 잘 일반화되는가?
다음과 같이 분해할 수 있습니다:
$\hat{f}$의 일반화 오차 $= bias^2 + variance + \text{irreducible error}$


모델 복잡도: $\hat{f}$의 유연성을 결정합니다.
예: 최대 트리 깊이, 리프당 최소 샘플 수, ...


Python으로 배우는 트리 기반 Machine Learning