Transformer les entrées avant la modélisation

Apprentissage supervisé en R : Régression

Nina Zumel and John Mount

Win-Vector LLC

Pourquoi transformer les variables d'entrée

  • Connaissances du domaine/variables synthétiques
    • $Intelligence \sim \frac{mass.brain}{mass.body^{2/3}}$
Apprentissage supervisé en R : Régression

Pourquoi transformer les variables d'entrée

  • Connaissances du domaine/variables synthétiques
    • $Intelligence \sim \frac{mass.brain}{mass.body^{2/3}}$
  • Raisons pragmatiques
    • Transformation logarithmique pour réduire la plage dynamique
    • Transformation logarithmique si les variations pertinentes sont multiplicatives
Apprentissage supervisé en R : Régression

Pourquoi transformer les variables d'entrée

  • Connaissances du domaine/variables synthétiques
    • $Intelligence \sim \frac{mass.brain}{mass.body^{2/3}}$
  • Raisons pragmatiques
    • Transformation logarithmique pour réduire la plage dynamique
    • Transformation logarithmique si les variations pertinentes sont multiplicatives
    • $y$ est approximativement linéaire en $f(x)$ plutôt qu'en $x$
Apprentissage supervisé en R : Régression

Exemple : prédire l'anxiété

Apprentissage supervisé en R : Régression

Transformer la variable hassles

Apprentissage supervisé en R : Régression

Plusieurs ajustements possibles

Quelle est la meilleure ?

  • anx ~ I(hassles^2)
  • anx ~ I(hassles^3)
  • anx ~ I(hassles^2) + I(hassles^3)
  • anx ~ exp(hassles)
  • ...

I() : traiter une expression littéralement (et non comme une interaction)

Apprentissage supervisé en R : Régression

Comparer différents modèles

Modèles linéaire, quadratique et cubique

mod_lin <- lm(anx ~ hassles, hassleframe)
summary(mod_lin)$r.squared
0.5334847
mod_quad <- lm(anx ~ I(hassles^2), hassleframe)
summary(mod_quad)$r.squared
0.6241029
mod_tritic <- lm(anx ~ I(hassles^3), hassleframe)
summary(mod_tritic)$r.squared
0.6474421
Apprentissage supervisé en R : Régression

Comparer différents modèles

Utiliser la validation croisée pour évaluer les modèles

Model RMSE
Linear ($hassles$) 7.69
Quadratic ($hassles^2$) 6.89
Cubic ($hassles^3$) 6.70
Apprentissage supervisé en R : Régression

Passons à la pratique !

Apprentissage supervisé en R : Régression

Preparing Video For Download...