정보와 특징 중요도

R에서의 차원 축소

Matt Pickard

Owner, Pickard Predictives, LLC

정보 이득에 관한 인용문

1 Provost, Foster; Fawcett, Tom (2013-07-27). Data Science for Business: What you need to know about data mining and data-analytic thinking. O'Reilly Media. Kindle Edition.
R에서의 차원 축소

특징 중요도

특징 중요도: 모델 구축에서 정보량의 척도

예측변수-타깃-모델 도식

특징 중요도를 재는 여러 방법

  • 타깃과의 상관관계
  • 회귀계수 표준화
  • 정보 이득
R에서의 차원 축소

의사결정나무 예시

모양, 색, 윤곽, 질감 특성을 가진 대출 연체 관측치 집합

R에서의 차원 축소

의사결정나무와 정보 이득

정보 이득: 한 변수를 관찰해 다른 변수에 대해 알게 되는 정보량

정보 이득 식

어떤 특징으로 집합을 분할

R에서의 차원 축소

엔트로피

  • 무질서의 척도
  • 순도가 높을수록 엔트로피는 낮아짐
  • 엔트로피 범위: 0(완전 순도) ~ 1(최대 엔트로피)

엔트로피 그래프

R에서의 차원 축소

엔트로피: 루트 노드

엔트로피 식

p_yes <- 7/16

p_no <- 9/16
entropy_root <- -(p_yes * log2(p_yes)) + -(p_no * log2(p_no))
entropy_root
0.989

루트 노드의 관측치

R에서의 차원 축소

엔트로피: 자식 노드

p_left_yes <- 2/9

p_left_no <- 7/9
entropy_left <- -(p_left_yes * log2(p_left_yes)) + -(p_left_no * log2(p_left_no))

루트에서 첫 레벨로 분할한 결정나무

R에서의 차원 축소

엔트로피: 자식 노드

p_left_yes <- 2/9 

p_left_no <- 7/9
entropy_left <- -(p_left_yes * log2(p_left_yes)) + -(p_left_no * log2(p_left_no))
entropy_left
0.764

루트에서 첫 레벨로 분할한 결정나무

R에서의 차원 축소

엔트로피: 자식 노드

p_right_yes <- 5/7

p_right_no <- 2/7
entropy_right <- -(p_right_yes * log2(p_right_yes)) + -(p_right_no * log2(p_right_no))

루트에서 첫 레벨로 분할한 결정나무

R에서의 차원 축소

엔트로피: 자식 노드

p_right_yes <- 5/7 

p_right_no <- 2/7
entropy_right <- -(p_right_yes * log2(p_right_yes)) + -(p_right_no * log2(p_right_no))
entropy_right
0.863 

루트에서 첫 레벨로 분할한 결정나무

R에서의 차원 축소

정보 이득: 루트 → 자식

p_left <- 9/16

p_right <- 7/16
info_gain <- entropy_root - (p_left * entropy_left + p_right * entropy_right)
info_gain
0.181

루트에서 첫 레벨로 분할한 결정나무

R에서의 차원 축소

특징별 정보 이득 비교

특징 정보 이득
shape 0.181
texture 0.180
outline 0.106
color 0.106

분할에 물음표가 있는 결정나무

R에서의 차원 축소

Ayo berlatih!

R에서의 차원 축소

Preparing Video For Download...