Övervakad inlärning i R: Regression
Nina Zumel and John Mount
Win-Vector, LLC



Regularisering: inlärningshastighet $\eta \in(0,1)$
$$ M_2 = M_1 + \eta \gamma T_2 $$

Slutmodell:
$$ M = M_1 + \eta \sum \gamma_i T_i $$

Träningsfelet minskar hela tiden, men testfelet gör det inte
xgb.cv() med ett stort antal rundor (träd).xgb.cv() med ett stort antal rundor (träd).xgb.cv()$evaluation_log: registrerar uppskattat RMSE per runda.xgb.cv() med ett stort antal rundor (träd).xgb.cv()$evaluation_log: registrerar uppskattat RMSE per runda.xgboost() med nrounds = $n_{best}$Förbered data först
treatplan <- designTreatmentsZ(bikesJan, vars)
newvars <- treatplan$scoreFrame %>%
filter(code %in% c("clean", "lev")) %>%
use_series(varName)
bikesJan.treat <- prepare(treatplan, bikesJan, varRestriction = newvars)
För xgboost():
as.matrix(bikesJan.treat)bikesJan$cntcv <- xgb.cv(data = as.matrix(bikesJan.treat), label = bikesJan$cnt,
objective = "reg:squarederror",
nrounds = 100, nfold = 5, eta = 0.3, max_depth = 6)
Viktiga parametrar till xgb.cv() och xgboost()
data: indata som matris; label: utfallobjective: för regression – "reg:squarederror"nrounds: maximalt antal träd att anpassaeta: inlärningshastighetmax_depth: maximalt djup för enskilda trädnfold (endast xgb.cv()): antal folds för korsvalidering
elog <- as.data.frame(cv$evaluation_log)
(nrounds <- which.min(elog$test_rmse_mean))
78
nrounds <- 78
model <- xgboost(data = as.matrix(bikesJan.treat),
label = bikesJan$cnt,
nrounds = nrounds,
objective = "reg:squarederror",
eta = 0.3,
max_depth = 6)
Förbered februaridata och gör prediktioner
bikesFeb.treat <- prepare(treatplan, bikesFeb, varRestriction = newvars)
bikesFeb$pred <- predict(model, as.matrix(bikesFeb.treat))
Modellernas prestanda på februaridata
| Modell | RMSE |
|---|---|
| Kvasipoisson | 69,3 |
| Slumpmässiga skogar | 67,15 |
| Gradient boosting | 54,0 |
Prediktioner kontra faktiska cykeluthyrningar, februari

Prediktioner och timvisa cykeluthyrningar, februari

Övervakad inlärning i R: Regression