일반화 오차

Python으로 배우는 트리 기반 Machine Learning

Elie Kawerk

Data Scientist

지도 학습 - 내부 원리

  • 지도 학습: $y =f(x)$, $f$는 미지수.

잡음 데이터셋

Python으로 배우는 트리 기반 Machine Learning

지도 학습의 목표

  • $f$를 가장 잘 근사하는 모델 $\hat{f}$ 찾기: $\hat{f} \approx f$

  • $\hat{f}$는 로지스틱 회귀, 결정 트리, 신경망 등이 될 수 있음.

  • 잡음을 최대한 제거합니다.

  • 최종 목표: $\hat{f}$가 새로운 데이터셋에서 낮은 예측 오차를 달성해야 합니다.

Python으로 배우는 트리 기반 Machine Learning

$f$ 근사의 어려움

  • 과적합(Overfitting):

    $\hat{f}(x)$가 훈련 세트의 잡음에 맞춰집니다.

  • 과소적합(Underfitting):

    $\hat{f}$가 $f$를 근사하기에 충분히 유연하지 않습니다.

Python으로 배우는 트리 기반 Machine Learning

과적합(Overfitting)

과적합

Python으로 배우는 트리 기반 Machine Learning

과소적합(Underfitting)

과소적합

Python으로 배우는 트리 기반 Machine Learning

일반화 오차

  • $\hat{f}$의 일반화 오차: $\hat{f}$는 새로운 데이터에 잘 일반화되는가?

  • 다음과 같이 분해할 수 있습니다:

    $\hat{f}$의 일반화 오차 $= bias^2 + variance + \text{irreducible error}$

Python으로 배우는 트리 기반 Machine Learning

편향(Bias)

  • 편향(Bias): 평균적으로 $\hat{f} \neq f$인 정도를 나타내는 오차 항.

높은 편향

Python으로 배우는 트리 기반 Machine Learning

분산(Variance)

  • 분산(Variance): 훈련 세트에 따라 $\hat{f}$가 얼마나 달라지는지를 나타냄.

높은 분산

Python으로 배우는 트리 기반 Machine Learning

모델 복잡도

  • 모델 복잡도: $\hat{f}$의 유연성을 결정합니다.

  • 예: 최대 트리 깊이, 리프당 최소 샘플 수, ...

Python으로 배우는 트리 기반 Machine Learning

편향-분산 트레이드오프

일반화 오차 분해

Python으로 배우는 트리 기반 Machine Learning

편향-분산 트레이드오프: 시각적 설명

편향-분산 시각화

Python으로 배우는 트리 기반 Machine Learning

연습해 봅시다!

Python으로 배우는 트리 기반 Machine Learning

Preparing Video For Download...