ANOVA

R による数値データの推測

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

ランナー

R による数値データの推測

語彙スコアと自己申告社会階層のANOVA

$H_0$: 語彙スコアの平均はすべての社会階層で同じである。$\mu_{lower} = \mu_{working} = \mu_{middle} = \mu_{upper}$

$H_A$: 少なくとも1つの社会階層間で語彙スコアの平均に差がある。

R による数値データの推測

変動の分割

語彙スコアの総変動:

  • 社会階層の違いに起因する変動 — グループ間変動
  • その他の要因に起因する変動 — グループ内変動
R による数値データの推測

ANOVA出力

library(broom)

aov(wordsum ~ class, gss) %>%
  tidy()
term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
R による数値データの推測

平方和

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
  • $SST = 236.5644 + 2869.8003 = 3106.365$ — 応答変数の総変動を測定する
  • 分散と同様の方法で計算される(標本サイズによるスケーリングなし)
  • 説明変動の割合 = $\frac{236.5644}{3106.365} = 7.6\%$
R による数値データの推測

F統計量

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA

F統計量 = 21.73467 = $\frac{between~group~var}{within~group~var}$

F統計量とp値

R による数値データの推測

練習しましょう!

R による数値データの推測

Preparing Video For Download...