Mesures d'erreur hors échantillon

Machine Learning avec caret en R

Zach Mayer

Data Scientist at DataRobot and co-author of caret

Erreur hors échantillon

  • Vouloir des modèles qui ne surajustent pas et généralisent bien
  • Les modèles performent-ils sur de nouvelles données ?
  • Tester les modèles sur de nouvelles données, ou un ensemble de test
    • Idée clé du Machine Learning
    • La validation dans l'échantillon mène presque assurément au surajustement
  • Objectif principal de caret et de ce cours : éviter le surajustement
Machine Learning avec caret en R

Exemple : RMSE hors échantillon

# Fit a model to the mtcars data
data(mtcars)
model <- lm(mpg ~ hp, mtcars[1:20, ])
# Predict out-of-sample
predicted <- predict(
  model, mtcars[21:32, ], type = "response"
)
# Evaluate error
actual <- mtcars[21:32, "mpg"]
sqrt(mean((predicted - actual) ^ 2))
5.507236
Machine Learning avec caret en R

Comparer au RMSE dans l'échantillon

# Fit a model to the full dataset
model2 <- lm(mpg ~ hp, mtcars)
# Predict in-sample
predicted2 <- predict(
  model, mtcars, type = "response"
)
# Evaluate error
actual2 <- mtcars[, "mpg"]
sqrt(mean((predicted2 - actual2) ^ 2))
3.74

Comparer au RMSE hors échantillon de 5,5.

Machine Learning avec caret en R

Passons à la pratique !

Machine Learning avec caret en R

Preparing Video For Download...