方差分析(ANOVA)

R 中的数值数据推断

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

跑者

R 中的数值数据推断

词汇分与自我认定社会阶层的方差分析

$H_0$:各社会阶层的平均词汇分相同,$\mu_{lower} = \mu_{working} = \mu_{middle} = \mu_{upper}$。

$H_A$:至少有一对社会阶层的平均词汇分不同。

R 中的数值数据推断

变异分解

词汇分的总变异:

  • 由社会阶层差异导致的变异 —— 组间变异
  • 由其他因素导致的变异 —— 组内变异
R 中的数值数据推断

ANOVA 输出

library(broom)

aov(wordsum ~ class, gss) %>%
  tidy()
term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
R 中的数值数据推断

平方和(Sum of Squares)

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
  • $SST = 236.5644 + 2869.8003 = 3106.365$ —— 衡量响应变量的总变异
  • 计算方法与方差类似(但未按样本量缩放)
  • 解释变异占比 = $\frac{236.5644}{3106.365} = 7.6\%$
R 中的数值数据推断

F 统计量

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA

F 统计量 = 21.73467 = $\frac{组间方差}{组内方差}$

F 统计量与 p 值

R 中的数值数据推断

让我们来练习!

R 中的数值数据推断

Preparing Video For Download...