Metriky přesnosti: regresní modely

Validace modelů v Pythonu

Kasey Jones

Data Scientist

Regresní modely

Regresní modely klasifikují spojité proměnné, například počet bodů, galonů nebo štěňat.

Validace modelů v Pythonu

Střední absolutní chyba (MAE)

 

$$ MAE = \frac{\sum_{i=1}^{n} |y_i - \hat{y}_i|}{n} $$

  • Nejjednodušší a nejintuitivnější metrika
  • Zachází se všemi body stejně
  • Není citlivá na odlehlé hodnoty
Validace modelů v Pythonu

Střední kvadratická chyba (MSE)

 

$$ MSE = \frac{\sum_{i=1}^{n} (y_i - \hat{y}_i) ^2}{n} $$

  • Nejpoužívanější regresní metrika
  • Odlehlé hodnoty mají větší vliv na celkovou chybu
  • Náhodné výjimečné situace mohou vést k velkým chybám předpovědí
Validace modelů v Pythonu

MAE vs. MSE

  • Metriky přesnosti jsou vždy závislé na aplikaci
  • Chybové hodnoty MAE a MSE mají různé jednotky a nelze je porovnávat
Validace modelů v Pythonu

Střední absolutní chyba

rfr = RandomForestRegressor(n_estimators=500, random_state=1111)
rfr.fit(X_train, y_train)
test_predictions = rfr.predict(X_test)

sum(abs(y_test - test_predictions))/len(test_predictions)
9.99
from sklearn.metrics import mean_absolute_error
mean_absolute_error(y_test, test_predictions)
9.99
Validace modelů v Pythonu

Střední kvadratická chyba

sum(abs(y_test - test_predictions)**2)/len(test_predictions)
141.4
from sklearn.metrics import mean_squared_error
mean_squared_error(y_test, test_predictions)
141.4
Validace modelů v Pythonu

Přesnost pro podmnožinu dat

chocolate_preds = rfr.predict(X_test[X_test[:, 1] == 1])
mean_absolute_error(y_test[X_test[:, 1] == 1], chocolate_preds)
8.79
nonchocolate_preds = rfr.predict(X_test[X_test[:, 1] == 0])
mean_absolute_error(y_test[X_test[:, 1] == 0], nonchocolate_preds)
10.99
Validace modelů v Pythonu

Pojďme cvičit!

Validace modelů v Pythonu

Preparing Video For Download...