回歸樹的效能指標

R 的樹狀模型機器學習

Sandro Raabe

Data Scientist

如何衡量效能?

  • 分類問題:accuracy(混淆矩陣)
  • 回歸問題:「正確」是相對的,沒有二元正確性

$\Rightarrow$ 衡量預測與真值的偏離程度

R 的樹狀模型機器學習

常見回歸指標

  • 平均絕對誤差(MAE)
  • 均方根誤差(RMSE)

 

MAE 直觀:

平均差異的圖

 

 

 

 

 

MAE = 紅色長條的平均長度

R 的樹狀模型機器學習

公式與直觀

 

$$MAE = \frac{1}{n} \sum_{i=1}^n\left| actual_i - predicted_i \right|$$

 

  • 「絕對偏差總和除以預測筆數」

$$\quad MSE = \quad \frac{1}{n} \sum_{i=1}^n\left( actual_i - predicted_i \right)^2$$

  •                   「均方誤差」
R 的樹狀模型機器學習

公式與直觀

 

$$MAE = \frac{1}{n} \sum_{i=1}^n\left| actual_i - predicted_i \right|$$

 

  • 「絕對偏差總和除以預測筆數」

$$RMSE = \sqrt{\frac{1}{n} \sum_{i=1}^n\left( actual - predicted \right)^2}$$

  • 「均方誤差的平方根」
  • 大誤差權重更高
R 的樹狀模型機器學習

程式碼:產生預測

# parsnip 和 yardstick 包含在 tidymodels 中
library(tidymodels)
# 產生預測並加入測試資料
predictions <- predict(model, new_data = chocolate_test) %>%

bind_cols(chocolate_test)
# A tibble: 358 x 7
   .pred final_grade review_date cocoa_percent company_location
   <dbl>       <dbl>       <int>         <dbl> <fct>           
 1  2.5         2.75        2013          0.7  France          
 2  3.64        3.25        2014          0.8  France          
 3  3.3         3.5         2012          0.7  France          
 4  3.25        3.5         2011          0.72 Fiji            
# ... with 354 more rows, and 2 more variables: bean_type <fct>, broad_bean_origin <fct>
R 的樹狀模型機器學習

程式碼:mae() 與 rmse()

# 使用 mae() 評估
mae(predictions,

estimate = .pred,
truth = final_grade)
# A tibble: 1 x 2
  .metric   .estimate
  <chr>         <dbl>
1 mae           0.363
# 使用 rmse() 評估
rmse(predictions,
     estimate = .pred,
     truth = final_grade)
# A tibble: 1 x 2
  .metric   .estimate
  <chr>         <dbl>
1 rmse          0.457
R 的樹狀模型機器學習

一起來評估吧!

R 的樹狀模型機器學習

Preparing Video For Download...