ANOVA

Inferență pentru date numerice în R

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

Alergători

Inferență pentru date numerice în R

ANOVA pentru scoruri de vocabular vs. clasa socială auto-identificată

$H_0$: Scorul mediu de vocabular este același pentru toate clasele sociale, $\mu_{lower} = \mu_{working} = \mu_{middle} = \mu_{upper}$.

$H_A$: Scorurile medii de vocabular diferă pentru cel puțin o pereche de clase sociale.

Inferență pentru date numerice în R

Partiționarea variabilității

Variabilitatea totală a scorului de vocabular:

  • Variabilitatea atribuită diferențelor dintre clasele sociale – variabilitate între grupuri
  • Variabilitatea atribuită altor factori – variabilitate în interiorul grupurilor
Inferență pentru date numerice în R

Rezultatele ANOVA

library(broom)

aov(wordsum ~ class, gss) %>%
  tidy()
term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
Inferență pentru date numerice în R

Suma pătratelor

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
  • $SST = 236.5644 + 2869.8003 = 3106.365$ – Măsoară variabilitatea totală a variabilei de răspuns
  • Calculat similar cu varianța (fără scalare după dimensiunea eșantionului)
  • Procentul variabilității explicate = $\frac{236.5644}{3106.365} = 7.6\%$
Inferență pentru date numerice în R

Statistica F

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA

Statistica F = 21.73467 = $\frac{between~group~var}{within~group~var}$

Statistica F și valoarea p

Inferență pentru date numerice în R

Să exersăm!

Inferență pentru date numerice în R

Preparing Video For Download...