Mesures de justesse : modèles de régression

Validation de modèles en Python

Kasey Jones

Data Scientist

Modèles de régression

Les modèles de régression prédisent des variables continues, comme un nombre de points, de gallons ou de chiots.

Validation de modèles en Python

Erreur absolue moyenne (MAE)

 

$$ MAE = \frac{\sum_{i=1}^{n} |y_i - \hat{y}_i|}{n} $$

  • Mesure la plus simple et la plus intuitive
  • Traite tous les points de façon égale
  • Peu sensible aux valeurs aberrantes
Validation de modèles en Python

Erreur quadratique moyenne (MSE)

 

$$ MSE = \frac{\sum_{i=1}^{n} (y_i - \hat{y}_i) ^2}{n} $$

  • Mesure de régression la plus utilisée
  • Laisse les valeurs aberrantes peser davantage dans l'erreur globale
  • Des voyages imprévus en famille peuvent causer de grandes erreurs de prédiction
Validation de modèles en Python

MAE vs MSE

  • Les mesures de justesse dépendent toujours du contexte d'usage
  • Les unités de MAE et de MSE diffèrent ; ne pas les comparer directement
Validation de modèles en Python

Erreur absolue moyenne

rfr = RandomForestRegressor(n_estimators=500, random_state=1111)
rfr.fit(X_train, y_train)
test_predictions = rfr.predict(X_test)

sum(abs(y_test - test_predictions))/len(test_predictions)
9.99
from sklearn.metrics import mean_absolute_error
mean_absolute_error(y_test, test_predictions)
9.99
Validation de modèles en Python

Erreur quadratique moyenne

sum(abs(y_test - test_predictions)**2)/len(test_predictions)
141.4
from sklearn.metrics import mean_squared_error
mean_squared_error(y_test, test_predictions)
141.4
Validation de modèles en Python

Justesse pour un sous-ensemble de données

chocolate_preds = rfr.predict(X_test[X_test[:, 1] == 1])
mean_absolute_error(y_test[X_test[:, 1] == 1], chocolate_preds)
8.79
nonchocolate_preds = rfr.predict(X_test[X_test[:, 1] == 0])
mean_absolute_error(y_test[X_test[:, 1] == 0], nonchocolate_preds)
10.99
Validation de modèles en Python

Passons à la pratique !

Validation de modèles en Python

Preparing Video For Download...