Kvantifikace kvality modelu

Úvod do regrese s knihovnou statsmodels v Pythonu

Maarten Van den Broeck

Content Developer at DataCamp

Modely pro cejny a okouny

Cejn Graf rozptylu hmotnosti cejnů vs. jejich délek s regresní přímkou, zobrazený dříve.

Okoun Graf rozptylu hmotnosti okounů vs. jejich délek s regresní přímkou, zobrazený dříve.

Úvod do regrese s knihovnou statsmodels v Pythonu

Koeficient determinace

Někdy označovaný jako „r-squared" nebo „R-squared".

Podíl rozptylu cílové proměnné, který je předpověditelný z vysvětlující proměnné

  • 1 znamená dokonalou shodu
  • 0 znamená nejhorší možnou shodu
Úvod do regrese s knihovnou statsmodels v Pythonu

`.summary()`

Podívejte se na hodnotu označenou „R-Squared"

mdl_bream = ols("mass_g ~ length_cm", data=bream).fit()
print(mdl_bream.summary())
# Some lines of output omitted                          

                            OLS Regression Results                         
Dep. Variable:                 mass_g   R-squared:                       0.878
Model:                            OLS   Adj. R-squared:                  0.874
Method:                 Least Squares   F-statistic:                     237.6
Úvod do regrese s knihovnou statsmodels v Pythonu

Atribut `.rsquared`

print(mdl_bream.rsquared)
0.8780627095147174
Úvod do regrese s knihovnou statsmodels v Pythonu

Je to jen korelace na druhou

coeff_determination = bream["length_cm"].corr(bream["mass_g"]) ** 2
print(coeff_determination)
0.8780627095147173
Úvod do regrese s knihovnou statsmodels v Pythonu

Reziduální standardní chyba (RSE)

Rezidua grafu hmotnosti vs. délky cejna, jak bylo zobrazeno dříve

  • „Typický" rozdíl mezi předpovědí a pozorovanou hodnotou
  • Má stejnou jednotku jako cílová proměnná.
  • MSE = RSE²
Úvod do regrese s knihovnou statsmodels v Pythonu

Atribut `.mse_resid`

mse = mdl_bream.mse_resid
print('mse: ', mse)
mse:  5498.555084973521
rse = np.sqrt(mse)
print("rse: ", rse)
rse:  74.15224261594197
Úvod do regrese s knihovnou statsmodels v Pythonu

Výpočet RSE: rezidua na druhou

residuals_sq = mdl_bream.resid ** 2

print("residuals sq: \n", residuals_sq)
residuals sq: 
0      138.957118
1      260.758635
2     5126.992578
3     1318.919660
4      390.974309
    ...
30    2125.047026
31    6576.923291
32     206.259713
33     889.335096
34    7665.302003
Length: 35, dtype: float64
Úvod do regrese s knihovnou statsmodels v Pythonu

Výpočet RSE: součet čtverců reziduí

residuals_sq = mdl_bream.resid ** 2

resid_sum_of_sq = sum(residuals_sq)

print("resid sum of sq :",
      resid_sum_of_sq)
resid sum of sq : 181452.31780412616
Úvod do regrese s knihovnou statsmodels v Pythonu

Výpočet RSE: stupně volnosti

residuals_sq = mdl_bream.resid ** 2

resid_sum_of_sq = sum(residuals_sq)

deg_freedom = len(bream.index) - 2

print("deg freedom: ", deg_freedom)

Stupně volnosti se rovnají počtu pozorování minus počet koeficientů modelu.

deg freedom:  33
Úvod do regrese s knihovnou statsmodels v Pythonu

Výpočet RSE: odmocnina podílu

residuals_sq = mdl_bream.resid ** 2

resid_sum_of_sq = sum(residuals_sq)

deg_freedom = len(bream.index) - 2

rse = np.sqrt(resid_sum_of_sq/deg_freedom)

print("rse :", rse)
rse : 74.15224261594197
Úvod do regrese s knihovnou statsmodels v Pythonu

Interpretace RSE

mdl_bream má RSE 74.

Rozdíl mezi předpovězenou a skutečnou hmotností cejnů je typicky přibližně 74 g.

Úvod do regrese s knihovnou statsmodels v Pythonu

Střední kvadratická chyba (RMSE)

residuals_sq = mdl_bream.resid ** 2

resid_sum_of_sq = sum(residuals_sq)

deg_freedom = len(bream.index) - 2

rse = np.sqrt(resid_sum_of_sq/deg_freedom)

print("rse :", rse)
rse : 74.15224261594197
residuals_sq = mdl_bream.resid ** 2

resid_sum_of_sq = sum(residuals_sq)

n_obs = len(bream.index)

rmse = np.sqrt(resid_sum_of_sq/n_obs)

print("rmse :", rmse)
rmse : 72.00244396727619
Úvod do regrese s knihovnou statsmodels v Pythonu

Pojďme si procvičit!

Úvod do regrese s knihovnou statsmodels v Pythonu

Preparing Video For Download...