交叉驗證

R 的樹狀模型機器學習

Sandro Raabe

Data Scientist

k 折交叉驗證

資料分成 k 個折數

R 的樹狀模型機器學習

k 折交叉驗證

第 1 折作為測試集

R 的樹狀模型機器學習

k 折交叉驗證

第 2 折作為測試集

R 的樹狀模型機器學習

k 折交叉驗證

第 3 折作為測試集

R 的樹狀模型機器學習

k 折交叉驗證

第 4 折作為測試集

R 的樹狀模型機器學習

k 折交叉驗證

第 5 折作為測試集

R 的樹狀模型機器學習

k 折交叉驗證

交叉驗證後的總 MAE

R 的樹狀模型機器學習

在完整資料集上訓練最終模型

在完整資料集上訓練最終模型

R 的樹狀模型機器學習

程式實作-將資料切成 10 份

# Random seed for reproducibility
set.seed(100)

# Create 10 folds of the dataset
chocolate_folds <- vfold_cv(chocolate_train, v = 10)
#  10-fold cross-validation
# A tibble: 10 x 2
  splits             id
1 <split [1293/144]> Fold1
2 <split [1293/144]> Fold2
3 <split [1293/144]> Fold3
4 ...
R 的樹狀模型機器學習

程式實作-對各折進行訓練

# Fit a model for every fold and calculate MAE and RMSE
fits_cv <- fit_resamples(tree_spec,

final_grade ~ .,
resamples = chocolate_folds,
metrics = metric_set(mae, rmse))
# Resampling results
# 10-fold cross-validation
# A tibble: 10 x 4
  splits             id    .metrics
  <list>             <chr> <list>
1 <split [1293/144]> Fold1 <tibble [2 x 4]>
2 <split [1293/144]> Fold2 <tibble [2 x 4]>
3 <split [1293/144]> Fold3 <tibble [2 x 4]>
4 ...
R 的樹狀模型機器學習

程式實作-彙整所有誤差

# Collect raw errors of all model runs
all_errors <- collect_metrics(fits_cv, 
                              summarize = FALSE)

print(all_errors)
# A tibble: 20 x 3
   id      .metric  .estimate
   <chr>     <chr>      <dbl>
 1 Fold01      mae      0.362
 2 Fold01     rmse      0.442
 3 Fold02      mae      0.385
 4 Fold02     rmse      0.504
 5 ...
library(ggplot2)
ggplot(all_errors, aes(x = .estimate, 
                       fill = .metric)) +
   geom_histogram()

誤差的直方圖

R 的樹狀模型機器學習

程式實作-摘要訓練結果

# Collect and summarize errors of all model runs
collect_metrics(fits_cv)
# A tibble: 2 x 3
  .metric   mean      n
  <chr>    <dbl>  <int>
1 mae      0.383     10
2 rmse     0.477     10
R 的樹狀模型機器學習

開始做交叉驗證!

R 的樹狀模型機器學習

Preparing Video For Download...