Evaluar el rendimiento del modelo

Regresión intermedia con statsmodels en Python

Maarten Van den Broeck

Content Developer at DataCamp

Métricas de rendimiento del modelo

  • Coeficiente de determinación (R-cuadrado): qué tan bien la recta de regresión lineal ajusta los valores observados.

    • Más grande es mejor.
  • Error estándar residual (RSE): tamaño típico de los residuos.

    • Más pequeño es mejor.
Regresión intermedia con statsmodels en Python

Obtener el coeficiente de determinación

print(mdl_mass_vs_length.rsquared)
0.8225689502644215
print(mdl_mass_vs_species.rsquared)
0.25814887709499157
print(mdl_mass_vs_both.rsquared)
0.9200433561156649
Regresión intermedia con statsmodels en Python

Coeficiente de determinación ajustado

  • Más variables explicativas aumentan $R^2$.
  • Demasiadas variables explicativas causan sobreajuste.
  • El coeficiente de determinación ajustado penaliza añadir variables.
  • $\bar{R ^ 2} = 1 - (1 - R ^ 2) \frac{n_{obs} - 1}{n_{obs} - n_{var} - 1}$
  • La penalización se nota cuando $R^2$ es pequeño o $n_{var}$ es gran fracción de $n_{obs}$.
  • En statsmodels, está en el atributo rsquared_adj.
Regresión intermedia con statsmodels en Python

Obtener el coeficiente de determinación ajustado

print("rsq_length: ", mdl_mass_vs_length.rsquared)
print("rsq_adj_length: ", mdl_mass_vs_length.rsquared_adj)
rsq_length:  0.8225689502644215
rsq_adj_length:  0.8211607673300121
print("rsq_species: ", mdl_mass_vs_species.rsquared)
print("rsq_adj_species: ", mdl_mass_vs_species.rsquared_adj)
rsq_species:  0.25814887709499157
rsq_adj_species:  0.24020086605696722
print("rsq_both: ", mdl_mass_vs_both.rsquared
print("rsq_adj_both: ", mdl_mass_vs_both.rsquared_adj)
rsq_both:  0.9200433561156649
rsq_adj_both:  0.9174431400543857
Regresión intermedia con statsmodels en Python

Obtener el error estándar residual

rse_length = np.sqrt(mdl_mass_vs_length.mse_resid)
print("rse_length: ", rse_length)
rse_length:  152.12092835414788
rse_species = np.sqrt(mdl_mass_vs_species.mse_resid)
print("rse_species: ", rse_species)
rse_species:  313.5501156682592
rse_both = np.sqrt(mdl_mass_vs_both.mse_resid)
print("rse_both: ", rse_both)
rse_both:  103.35563303966488
Regresión intermedia con statsmodels en Python

¡Vamos a practicar!

Regresión intermedia con statsmodels en Python

Preparing Video For Download...