Övervakad inlärning i R: Regression
Nina Zumel and John Mount
Win-Vector, LLC


Rekommenderad metod när data finns i god tillgång



Föredras när datamängden är för liten för att avsätta ett testset



library(vtreat)
splitPlan <- kWayCrossValidation(nRows, nSplits, NULL, NULL)
nRows: antal rader i träningsdatanSplits: antal folder (partitioner) i korsvalideringenlibrary(vtreat)
splitPlan <- kWayCrossValidation(10, 3, NULL, NULL)
Första fold (A och B för träning, C för test)
splitPlan[[1]]
$train
1 2 4 5 7 9 10
$app
3 6 8
Träna på A och B, testa på C, osv...
split <- splitPlan[[1]]
model <- lm(fmla, data = df[split$train,])
df$pred.cv[split$app] <- predict(model, newdata = df[split$app,])

| Måttyp | RMSE | $R^2$ |
|---|---|---|
| träning | 0,7082675 | 0,8029275 |
| test | 0,9349416 | 0,7451896 |
| korsvalidering | 0,8175714 | 0,7635331 |
Övervakad inlärning i R: Regression