Ocena wydajności modelu

Regresja średnio zaawansowana ze statsmodels w Pythonie

Maarten Van den Broeck

Content Developer at DataCamp

Metryki wydajności modelu

  • Współczynnik determinacji (R-kwadrat): jak dobrze linia regresji liniowej dopasowuje się do obserwowanych wartości.

    • Im większy, tym lepszy.
  • Resztowy błąd standardowy (RSE): typowa wielkość reszt.

    • Im mniejszy, tym lepszy.
Regresja średnio zaawansowana ze statsmodels w Pythonie

Obliczanie współczynnika determinacji

print(mdl_mass_vs_length.rsquared)
0.8225689502644215
print(mdl_mass_vs_species.rsquared)
0.25814887709499157
print(mdl_mass_vs_both.rsquared)
0.9200433561156649
Regresja średnio zaawansowana ze statsmodels w Pythonie

Skorygowany współczynnik determinacji

  • Więcej zmiennych objaśniających zwiększa $R^2$.
  • Zbyt wiele zmiennych objaśniających powoduje przeuczenie.
  • Skorygowany współczynnik determinacji karze za liczbę zmiennych objaśniających.
  • $\bar{R ^ 2} = 1 - (1 - R ^ 2) \frac{n_{obs} - 1}{n_{obs} - n_{var} - 1}$
  • Kara jest zauważalna, gdy $R^2$ jest mały lub $n_{var}$ stanowi duży ułamek $n_{obs}$.
  • W statsmodels wartość ta jest zawarta w atrybucie rsquared_adj.
Regresja średnio zaawansowana ze statsmodels w Pythonie

Obliczanie skorygowanego współczynnika determinacji

print("rsq_length: ", mdl_mass_vs_length.rsquared)
print("rsq_adj_length: ", mdl_mass_vs_length.rsquared_adj)
rsq_length:  0.8225689502644215
rsq_adj_length:  0.8211607673300121
print("rsq_species: ", mdl_mass_vs_species.rsquared)
print("rsq_adj_species: ", mdl_mass_vs_species.rsquared_adj)
rsq_species:  0.25814887709499157
rsq_adj_species:  0.24020086605696722
print("rsq_both: ", mdl_mass_vs_both.rsquared
print("rsq_adj_both: ", mdl_mass_vs_both.rsquared_adj)
rsq_both:  0.9200433561156649
rsq_adj_both:  0.9174431400543857
Regresja średnio zaawansowana ze statsmodels w Pythonie

Obliczanie resztowego błędu standardowego

rse_length = np.sqrt(mdl_mass_vs_length.mse_resid)
print("rse_length: ", rse_length)
rse_length:  152.12092835414788
rse_species = np.sqrt(mdl_mass_vs_species.mse_resid)
print("rse_species: ", rse_species)
rse_species:  313.5501156682592
rse_both = np.sqrt(mdl_mass_vs_both.mse_resid)
print("rse_both: ", rse_both)
rse_both:  103.35563303966488
Regresja średnio zaawansowana ze statsmodels w Pythonie

Ćwiczenia!

Regresja średnio zaawansowana ze statsmodels w Pythonie

Preparing Video For Download...