樹狀方法的直覺

R 中的監督式學習:回歸

Nina Zumel and John Mount

Win-Vector, LLC

範例:用 Gestation Time 與 Litter Size 預測動物智力

R 中的監督式學習:回歸

決策樹

規則形式:

  • if a AND b AND c THEN y

非線性概念:

  • 區間
  • 非單調關係

非加性互動:

  • AND:類似乘法
R 中的監督式學習:回歸

決策樹

  • 若 Litter < 1.15 且 Gestation $\ge$ 268 $\rightarrow$ intelligence = 0.315
  • 若 Litter 屬於 [1.15, 4.3) $\rightarrow$ intelligence = 0.131
R 中的監督式學習:回歸

決策樹

優點:樹具有「表達力強的概念空間」

Model RMSE
linear 0.1200419
tree 0.1072732
R 中的監督式學習:回歸

決策樹

缺點:「粒度較粗」的預測

R 中的監督式學習:回歸

樹難以表達線性關係

樹會預測軸對齊的區域

每種顏色代表不同的預測值

R 中的監督式學習:回歸

樹難以表達線性關係

用階梯逼近直線很吃力

R 中的監督式學習:回歸

樹的其他問題

  • 切分太多(深樹):
    • 過於複雜,易過擬合
  • 切分太少(淺樹):
    • 預測粒度過粗
R 中的監督式學習:回歸

樹的集成法

集成比單一樹提供更細緻的預測

R 中的監督式學習:回歸

樹的集成法

集成模型比單一樹更能擬合動物智力資料

Model RMSE
linear 0.1200419
tree 0.1072732
random forest 0.0901681
R 中的監督式學習:回歸

一起來練習吧!

R 中的監督式學習:回歸

Preparing Video For Download...