ANOVA

Inferens för numeriska data i R

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

Löpare

Inferens för numeriska data i R

ANOVA för ordförrådsspoäng jämfört med självskattad samhällsklass

$H_0$: Genomsnittspoängen i ordförråd är densamma för alla samhällsklasser, $\mu_{lower} = \mu_{working} = \mu_{middle} = \mu_{upper}$.

$H_A$: Genomsnittspoängen i ordförråd skiljer sig åt för minst ett par av samhällsklasserna.

Inferens för numeriska data i R

Variationsuppdelning

Total variation i ordförrådsspoäng:

  • Variation som kan tillskrivas skillnader i samhällsklass – variation mellan grupper
  • Variation som beror på alla övriga faktorer – variation inom grupper
Inferens för numeriska data i R

ANOVA-utdata

library(broom)

aov(wordsum ~ class, gss) %>%
  tidy()
term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
Inferens för numeriska data i R

Kvadratsummor

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
  • $SST = 236.5644 + 2869.8003 = 3106.365$ – Mäter den totala variationen i responsvariabeln
  • Beräknas på ungefär samma sätt som varians (men skaleras inte med urvalsstorleken)
  • Andel förklarad variation = $\frac{236.5644}{3106.365} = 7{,}6\%$
Inferens för numeriska data i R

F-statistika

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA

F-statistika = 21.73467 = $\frac{between~group~var}{within~group~var}$

F-statistika och p-värde

Inferens för numeriska data i R

Nu kör vi en övning!

Inferens för numeriska data i R

Preparing Video For Download...