ANOVA

R에서 수치형 데이터에 대한 추론

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

달리기 선수들

R에서 수치형 데이터에 대한 추론

어휘 점수 vs. 자기 인식 사회 계층에 대한 ANOVA

$H_0$: 모든 사회 계층에서 평균 어휘 점수는 동일하다, $\mu_{lower} = \mu_{working} = \mu_{middle} = \mu_{upper}$.

$H_A$: 적어도 한 쌍의 사회 계층 간 평균 어휘 점수에 차이가 있다.

R에서 수치형 데이터에 대한 추론

변동성 분할

어휘 점수의 전체 변동성:

  • 사회 계층 차이에 기인한 변동성 - 집단 간 변동성
  • 기타 요인에 기인한 변동성 - 집단 내 변동성
R에서 수치형 데이터에 대한 추론

ANOVA 출력 결과

library(broom)

aov(wordsum ~ class, gss) %>%
  tidy()
term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
R에서 수치형 데이터에 대한 추론

제곱합

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
  • $SST = 236.5644 + 2869.8003 = 3106.365$ - 반응 변수의 전체 변동성을 측정
  • 분산과 매우 유사하게 계산됨 (표본 크기로 나누지 않음)
  • 설명된 변동성 비율 = $\frac{236.5644}{3106.365} = 7.6\%$
R에서 수치형 데이터에 대한 추론

F-통계량

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA

F-통계량 = 21.73467 = $\frac{between~group~var}{within~group~var}$

F-통계량과 p-값

R에서 수치형 데이터에 대한 추론

연습해 봅시다!

R에서 수치형 데이터에 대한 추론

Preparing Video For Download...