Evaluarea performanței modelului

Regresie intermediară cu statsmodels în Python

Maarten Van den Broeck

Content Developer at DataCamp

Metrici de performanță a modelului

  • Coeficientul de determinare (R-pătrat): cât de bine se potrivește linia de regresie liniară cu valorile observate.

    • O valoare mai mare este mai bună.
  • Eroarea standard reziduală (ESR): mărimea tipică a reziduurilor.

    • O valoare mai mică este mai bună.
Regresie intermediară cu statsmodels în Python

Obținerea coeficientului de determinare

print(mdl_mass_vs_length.rsquared)
0.8225689502644215
print(mdl_mass_vs_species.rsquared)
0.25814887709499157
print(mdl_mass_vs_both.rsquared)
0.9200433561156649
Regresie intermediară cu statsmodels în Python

Coeficientul de determinare ajustat

  • Mai multe variabile explicative cresc $R^2$.
  • Prea multe variabile explicative duc la supraajustare.
  • Coeficientul de determinare ajustat penalizează variabilele explicative suplimentare.
  • $\bar{R ^ 2} = 1 - (1 - R ^ 2) \frac{n_{obs} - 1}{n_{obs} - n_{var} - 1}$
  • Penalizarea este vizibilă când $R^2$ este mic sau $n_{var}$ reprezintă o fracție mare din $n_{obs}$.
  • În statsmodels, se regăsește în atributul rsquared_adj.
Regresie intermediară cu statsmodels în Python

Obținerea coeficientului de determinare ajustat

print("rsq_length: ", mdl_mass_vs_length.rsquared)
print("rsq_adj_length: ", mdl_mass_vs_length.rsquared_adj)
rsq_length:  0.8225689502644215
rsq_adj_length:  0.8211607673300121
print("rsq_species: ", mdl_mass_vs_species.rsquared)
print("rsq_adj_species: ", mdl_mass_vs_species.rsquared_adj)
rsq_species:  0.25814887709499157
rsq_adj_species:  0.24020086605696722
print("rsq_both: ", mdl_mass_vs_both.rsquared
print("rsq_adj_both: ", mdl_mass_vs_both.rsquared_adj)
rsq_both:  0.9200433561156649
rsq_adj_both:  0.9174431400543857
Regresie intermediară cu statsmodels în Python

Obținerea erorii standard reziduale

rse_length = np.sqrt(mdl_mass_vs_length.mse_resid)
print("rse_length: ", rse_length)
rse_length:  152.12092835414788
rse_species = np.sqrt(mdl_mass_vs_species.mse_resid)
print("rse_species: ", rse_species)
rse_species:  313.5501156682592
rse_both = np.sqrt(mdl_mass_vs_both.mse_resid)
print("rse_both: ", rse_both)
rse_both:  103.35563303966488
Regresie intermediară cu statsmodels în Python

Să exersăm!

Regresie intermediară cu statsmodels în Python

Preparing Video For Download...