Modellemeden önce girdileri dönüştürme

R'de Supervised Learning: Regresyon

Nina Zumel and John Mount

Win-Vector LLC

Girdi Değişkenlerini Neden Dönüştürmeli

  • Alan bilgisi/yapay değişkenler
    • $Intelligence \sim \frac{mass.brain}{mass.body^{2/3}}$
R'de Supervised Learning: Regresyon

Girdi Değişkenlerini Neden Dönüştürmeli

  • Alan bilgisi/yapay değişkenler
    • $Intelligence \sim \frac{mass.brain}{mass.body^{2/3}}$
  • Pragmatik nedenler
    • Dinamik aralığı azaltmak için log dönüşüm
    • Değişkendeki anlamlı değişimler çarpımsal olduğunda log dönüşüm
R'de Supervised Learning: Regresyon

Girdi Değişkenlerini Neden Dönüştürmeli

  • Alan bilgisi/yapay değişkenler
    • $Intelligence \sim \frac{mass.brain}{mass.body^{2/3}}$
  • Pragmatik nedenler
    • Dinamik aralığı azaltmak için log dönüşüm
    • Değişkendeki anlamlı değişimler çarpımsal olduğunda log dönüşüm
    • $y$, $x$'ten çok $f(x)$ ile yaklaşık doğrusal
R'de Supervised Learning: Regresyon

Örnek: Anksiyete Tahmini

R'de Supervised Learning: Regresyon

Hassles değişkenini dönüştürme

R'de Supervised Learning: Regresyon

Farklı olası uyumlar

Hangisi daha iyi?

  • anx ~ I(hassles^2)
  • anx ~ I(hassles^3)
  • anx ~ I(hassles^2) + I(hassles^3)
  • anx ~ exp(hassles)
  • ...

I(): bir ifadeyi olduğu gibi ele al (etkileşim olarak değil)

R'de Supervised Learning: Regresyon

Farklı modelleri karşılaştır

Doğrusal, Karesel ve Kübik modeller

mod_lin <- lm(anx ~ hassles, hassleframe)
summary(mod_lin)$r.squared
0.5334847
mod_quad <- lm(anx ~ I(hassles^2), hassleframe)
summary(mod_quad)$r.squared
0.6241029
mod_tritic <- lm(anx ~ I(hassles^3), hassleframe)
summary(mod_tritic)$r.squared
0.6474421
R'de Supervised Learning: Regresyon

Farklı modelleri karşılaştır

Modelleri değerlendirmek için çapraz doğrulama kullan

Model RMSE
Doğrusal ($hassles$) 7.69
Karesel ($hassles^2$) 6.89
Kübik ($hassles^3$) 6.70
R'de Supervised Learning: Regresyon

Hadi pratik yapalım!

R'de Supervised Learning: Regresyon

Preparing Video For Download...