資訊與特徵重要性

R 的降維

Matt Pickard

Owner, Pickard Predictives, LLC

關於資訊增益的引言

1 Provost, Foster; Fawcett, Tom (2013-07-27). Data Science for Business: What you need to know about data mining and data-analytic thinking. O'Reilly Media. Kindle Edition.
R 的降維

特徵重要性

特徵重要性:在建模中衡量資訊量

預測變數、目標與模型示意圖

衡量特徵重要性的多種方式

  • 與目標變數的相關性
  • 標準化迴歸係數
  • 資訊增益
R 的降維

決策樹範例

一組貸款違約觀測,含形狀、顏色、外框與紋理等特徵

R 的降維

決策樹與資訊增益

資訊增益:透過觀察一個變數,能了解另一個變數的資訊量

資訊增益公式

由某特徵將集合切分

R 的降維

熵(Entropy)

  • 混亂程度的度量。
  • 純度越高,熵越低。
  • 熵介於 0(完全純)到 1(完全混亂)。

熵圖

R 的降維

熵:根節點

熵的公式

p_yes <- 7/16

p_no <- 9/16
entropy_root <- -(p_yes * log2(p_yes)) + -(p_no * log2(p_no))
entropy_root
0.989

根節點中的觀測圖像

R 的降維

熵:子節點

p_left_yes <- 2/9

p_left_no <- 7/9
entropy_left <- -(p_left_yes * log2(p_left_yes)) + -(p_left_no * log2(p_left_no))

從根節點做第一次切分的決策樹

R 的降維

熵:子節點

p_left_yes <- 2/9 

p_left_no <- 7/9
entropy_left <- -(p_left_yes * log2(p_left_yes)) + -(p_left_no * log2(p_left_no))
entropy_left
0.764

從根節點做第一次切分的決策樹

R 的降維

熵:子節點

p_right_yes <- 5/7

p_right_no <- 2/7
entropy_right <- -(p_right_yes * log2(p_right_yes)) + -(p_right_no * log2(p_right_no))

從根節點做第一次切分的決策樹

R 的降維

熵:子節點

p_right_yes <- 5/7 

p_right_no <- 2/7
entropy_right <- -(p_right_yes * log2(p_right_yes)) + -(p_right_no * log2(p_right_no))
entropy_right
0.863 

從根節點做第一次切分的決策樹

R 的降維

資訊增益:根到子節點

p_left <- 9/16

p_right <- 7/16
info_gain <- entropy_root - (p_left * entropy_left + p_right * entropy_right)
info_gain
0.181

從根節點做第一次切分的決策樹

R 的降維

比較各特徵的資訊增益

特徵 資訊增益
shape 0.181
texture 0.180
outline 0.106
color 0.106

在切分處帶問號的決策樹

R 的降維

一起來練習吧!

R 的降維

Preparing Video For Download...