R-squared ($R^2$)

R में Supervised Learning: Regression

Nina Zumel and John Mount

Win-Vector LLC

$R^2$ क्या है?

मॉडल डेटा को कितना अच्छे से फिट करता है या समझाता है, इसका माप

  • मान 0-1 के बीच
    • 1 के पास: मॉडल अच्छा फिट होता है
    • 0 के पास: औसत मान का अंदाज़ा लगाने से बेहतर नहीं
R में Supervised Learning: Regression

$R^2$ कैसे निकालें

$R^2$ वह वैरिएंस है जो मॉडल समझाता है.

$$ R^2 = 1 - \frac{RSS}{SS_{Tot}} $$

जहाँ

  • $RSS = \sum{(y - prediction)^2}$
    • Residual sum of squares (मॉडल से विचलन)
  • $SS_{Tot} = \sum{(y - \overline{y})^2}$
    • Total sum of squares (डेटा का वैरिएंस)
R में Supervised Learning: Regression

हाउस प्राइस मॉडल का $R^2$ निकालें: RSS

  • एरर निकालें
err <- houseprices$prediction - houseprices$price
  • उसे स्क्वेयर करें और जोड़ें
rss <- sum(err^2)
  • price: वास्तविक बिक्री मूल्य का कॉलम (हजारों में)
  • pred: अनुमानित बिक्री मूल्य का कॉलम (हजारों में)
  • $RSS \approx$ 136138
R में Supervised Learning: Regression

हाउस प्राइस मॉडल का $R^2$ निकालें: $SS_{Tot}$

  • कीमतों का औसत मूल्य से अंतर लें
toterr <- houseprices$price - mean(houseprices$price)
  • उसे स्क्वेयर करें और जोड़ें
sstot <- sum(toterr^2)
  • $RSS \approx$ 136138
  • $SS_{Tot} \approx$ 713615
R में Supervised Learning: Regression

हाउस प्राइस मॉडल का $R^2$ निकालें

(r_squared <- 1 - (rss/sstot) )
0.8092278
  • $RSS \approx$ 136138
  • $SS_{Tot} \approx$ 713615
  • $R^2 \approx$ 0.809
R में Supervised Learning: Regression

lm() मॉडल से $R^2$ पढ़ना

# From summary()
summary(hmodel)
...
Residual standard error: 60.66 on 37 degrees of freedom
Multiple R-squared:  0.8092, Adjusted R-squared:  0.7989 
F-statistic: 78.47 on 2 and 37 DF,  p-value: 4.893e-14
summary(hmodel)$r.squared
0.8092278
# From glance()
glance(hmodel)$r.squared
0.8092278
R में Supervised Learning: Regression

Correlation और $R^2$

rho <- cor(houseprices$prediction, houseprices$price)
0.8995709
rho^2
0.8092278
  • $\rho$ = cor(prediction, price) = 0.8995709
  • $\rho^2$ = 0.8092278 = $R^2$
R में Supervised Learning: Regression

Correlation और $R^2$

  • उन मॉडलों के लिए सही जो squared error को न्यूनतम करते हैं:
    • Linear regression
    • GAM regression
    • वे tree-based algorithms जो squared error को न्यूनतम करते हैं
  • ट्रेनिंग डेटा के लिए सही; भविष्य के एप्लीकेशन डेटा के लिए सही नहीं
R में Supervised Learning: Regression

अभ्यास करते हैं!

R में Supervised Learning: Regression

Preparing Video For Download...