Apprentissage supervisé en R : Régression
Nina Zumel and John Mount
Win-Vector, LLC


Méthode recommandée quand les données sont abondantes



À privilégier quand l’ensemble de données est trop petit pour dégager un jeu de test



library(vtreat)
splitPlan <- kWayCrossValidation(nRows, nSplits, NULL, NULL)
nRows : nombre de lignes dans les données d’apprentissagenSplits : nombre de plis (partitions) pour la validation croiséelibrary(vtreat)
splitPlan <- kWayCrossValidation(10, 3, NULL, NULL)
Premier pli (A et B pour entraîner, C pour tester)
splitPlan[[1]]
$train
1 2 4 5 7 9 10
$app
3 6 8
Entraîner sur A et B, tester sur C, etc.
split <- splitPlan[[1]]
model <- lm(fmla, data = df[split$train,])
df$pred.cv[split$app] <- predict(model, newdata = df[split$app,])

| Type de mesure | RMSE | $R^2$ |
|---|---|---|
| apprentissage | 0,7082675 | 0,8029275 |
| test | 0,9349416 | 0,7451896 |
| validation croisée | 0,8175714 | 0,7635331 |
Apprentissage supervisé en R : Régression