ANOVA

Статистичні висновки для числових даних в R

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

Бігуни

Статистичні висновки для числових даних в R

ANOVA: словниковий запас vs самоідентифікований соціальний клас

$H_0$: Середній бал за словниковий запас однаковий у всіх соціальних класах, $\mu_{lower} = \mu_{working} = \mu_{middle} = \mu_{upper}$.

$H_A$: Середні бали за словниковий запас різняться щонайменше між однією парою соціальних класів.

Статистичні висновки для числових даних в R

Розклад варіативності

Загальна варіативність бала словникового запасу:

  • Варіативність, зумовлена відмінностями соціального класу — варіативність між групами
  • Варіативність, зумовлена всіма іншими чинниками — варіативність у межах групи
Статистичні висновки для числових даних в R

Вивід ANOVA

library(broom)

aov(wordsum ~ class, gss) %>%
  tidy()
term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
Статистичні висновки для числових даних в R

Сума квадратів

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
  • $SST = 236.5644 + 2869.8003 = 3106.365$ — вимірює загальну варіативність залежної змінної
  • Обчислюється подібно до дисперсії (але без ділення на обсяг вибірки)
  • Частка поясненої варіативності = $\frac{236.5644}{3106.365} = 7.6\%$
Статистичні висновки для числових даних в R

F-статистика

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA

F-статистика = 21.73467 = $\frac{between~group~var}{within~group~var}$

F-статистика і p-значення

Статистичні висновки для числових даних в R

Давайте потренуємось!

Статистичні висновки для числових даних в R

Preparing Video For Download...