트리 기반 방법의 직관

R로 하는 Supervised Learning: 회귀

Nina Zumel and John Mount

Win-Vector, LLC

예시: 임신 기간과 한배 새끼 수로 동물 지능 예측

R로 하는 Supervised Learning: 회귀

의사결정 트리

다음 형태의 규칙:

  • if a AND b AND c THEN y

비선형 개념

  • 구간
  • 비단조 관계

비가산 상호작용

  • AND: 곱셈과 유사
R로 하는 Supervised Learning: 회귀

의사결정 트리

  • IF Litter < 1.15 AND Gestation $\ge$ 268 $\rightarrow$ intelligence = 0.315
  • IF Litter IN [1.15, 4.3) $\rightarrow$ intelligence = 0.131
R로 하는 Supervised Learning: 회귀

의사결정 트리

장점: 트리는 풍부한 개념 공간을 가짐

모델 RMSE
선형 0.1200419
트리 0.1072732
R로 하는 Supervised Learning: 회귀

의사결정 트리

단점: 거친 예측

R로 하는 Supervised Learning: 회귀

트리는 선형 관계를 표현하기 어려움

트리는 축 정렬 영역을 예측함

각 색상은 서로 다른 예측값을 나타냄

R로 하는 Supervised Learning: 회귀

트리는 선형 관계를 표현하기 어려움

계단으로 직선을 표현하기 어려움

R로 하는 Supervised Learning: 회귀

트리의 기타 문제점

  • 분기가 너무 많은 트리 (깊은 트리):
    • 과도하게 복잡 - 과적합 위험
  • 분기가 너무 적은 트리 (얕은 트리):
    • 예측이 너무 거침
R로 하는 Supervised Learning: 회귀

트리 앙상블

앙상블은 단일 트리보다 세밀한 예측을 제공함

R로 하는 Supervised Learning: 회귀

트리 앙상블

앙상블 모델이 단일 트리보다 동물 지능 데이터에 더 잘 적합함

모델 RMSE
선형 0.1200419
트리 0.1072732
랜덤 포레스트 0.0901681
R로 하는 Supervised Learning: 회귀

연습해 봅시다!

R로 하는 Supervised Learning: 회귀

Preparing Video For Download...