मॉडलिंग से पहले इनपुट रूपांतरित करना

R में Supervised Learning: Regression

Nina Zumel and John Mount

Win-Vector LLC

इनपुट वैरिएबल्स को क्यों रूपांतरित करें

  • डोमेन नॉलेज/सिंथेटिक वैरिएबल्स
    • $Intelligence \sim \frac{mass.brain}{mass.body^{2/3}}$
R में Supervised Learning: Regression

इनपुट वैरिएबल्स को क्यों रूपांतरित करें

  • डोमेन नॉलेज/सिंथेटिक वैरिएबल्स
    • $Intelligence \sim \frac{mass.brain}{mass.body^{2/3}}$
  • व्यवहारिक कारण
    • डायनेमिक रेंज घटाने के लिए log ट्रांसफॉर्म
    • जब वैरिएबल में अर्थपूर्ण बदलाव गुणात्मक हों तो log ट्रांसफॉर्म
R में Supervised Learning: Regression

इनपुट वैरिएबल्स को क्यों रूपांतरित करें

  • डोमेन नॉलेज/सिंथेटिक वैरिएबल्स
    • $Intelligence \sim \frac{mass.brain}{mass.body^{2/3}}$
  • व्यवहारिक कारण
    • डायनेमिक रेंज घटाने के लिए log ट्रांसफॉर्म
    • जब वैरिएबल में अर्थपूर्ण बदलाव गुणात्मक हों तो log ट्रांसफॉर्म
    • $y$, $x$ की बजाय $f(x)$ में लगभग रैखिक
R में Supervised Learning: Regression

उदाहरण: Anxiety की भविष्यवाणी

R में Supervised Learning: Regression

hassles वैरिएबल को रूपांतरित करना

R में Supervised Learning: Regression

विभिन्न संभावित फिट्स

कौन सा बेहतर है?

  • anx ~ I(hassles^2)
  • anx ~ I(hassles^3)
  • anx ~ I(hassles^2) + I(hassles^3)
  • anx ~ exp(hassles)
  • ...

I(): किसी अभिव्यक्ति को शाब्दिक रूप से लें (इंटरैक्शन न मानें)

R में Supervised Learning: Regression

अलग-अलग मॉडलों की तुलना करें

Linear, Quadratic, और Cubic मॉडल

mod_lin <- lm(anx ~ hassles, hassleframe)
summary(mod_lin)$r.squared
0.5334847
mod_quad <- lm(anx ~ I(hassles^2), hassleframe)
summary(mod_quad)$r.squared
0.6241029
mod_tritic <- lm(anx ~ I(hassles^3), hassleframe)
summary(mod_tritic)$r.squared
0.6474421
R में Supervised Learning: Regression

अलग-अलग मॉडलों की तुलना करें

मॉडलों का आकलन करने के लिए cross-validation का उपयोग करें

Model RMSE
Linear ($hassles$) 7.69
Quadratic ($hassles^2$) 6.89
Cubic ($hassles^3$) 6.70
R में Supervised Learning: Regression

अभ्यास करते हैं!

R में Supervised Learning: Regression

Preparing Video For Download...