Machine Learning avec des modèles à base d'arbres en Python
Elie Kawerk
Data Scientist

Trouver un modèle $\hat{f}$ qui approxime au mieux $f$ : $\hat{f} \approx f$
$\hat{f}$ peut être une régression logistique, un arbre de décision, un réseau de neurones…
Écarter le bruit autant que possible.
But final : $\hat{f}$ doit obtenir une faible erreur prédictive sur des jeux de données non vus.
Surapprentissage :
$\hat{f}(x)$ ajuste le bruit de l'ensemble d'entraînement.
Sous-apprentissage :
$\hat{f}$ n'est pas assez flexible pour approximer $f$.


Erreur de généralisation de $\hat{f}$ : $\hat{f}$ généralise-t-il bien sur des données non vues ?
Elle se décompose ainsi :
Erreur de généralisation de $\hat{f} = bias^2 + variance + \text{erreur irréductible}$


Complexité du modèle : fixe la flexibilité de $\hat{f}$.
Exemple : profondeur max. de l'arbre, nombre minimal d'exemples par feuille, …


Machine Learning avec des modèles à base d'arbres en Python