t-통계량으로 p-값 계산하기

R로 하는 가설 검정

Richie Cotton

Data Evangelist at DataCamp

t-분포

  • 검정 통계량 t는 t-분포를 따릅니다.
  • t-분포는 자유도(df)라는 매개변수를 가집니다.
  • t-분포는 정규 분포와 유사하지만 꼬리가 더 두껍습니다.

자유도 1인 t-분포와 표준 정규 분포의 PDF를 비교한 그래프. t-분포는 꼬리가 더 두껍고 중간 봉우리가 더 낮습니다.

R로 하는 가설 검정

자유도

  • 자유도가 증가할수록 t-분포는 정규 분포에 가까워집니다.
  • 정규 분포는 자유도가 무한대인 t-분포입니다.
  • 자유도는 데이터 표본에서 논리적으로 독립적인 값의 최대 개수입니다.

다양한 자유도의 t-분포와 표준 정규 분포의 PDF를 비교한 그래프. 자유도가 증가할수록 꼬리가 좁아지고 봉우리가 높아져 정규 분포에 가까워집니다.

R로 하는 가설 검정

자유도 계산하기

  • 데이터셋에 독립 관측값이 5개 있다고 가정합니다.
  • 그 중 네 값은 2, 6, 8, 5입니다.
  • 표본 평균이 5임을 알고 있습니다.
  • 마지막 값은 더 이상 독립적이지 않으며 반드시 4여야 합니다.
  • 자유도는 4입니다.
  • $df = n_{child} + n_{adult} - 2$
R로 하는 가설 검정

가설

$H_{0}$: 어릴 때 코딩을 시작한 그룹과 성인이 된 후 시작한 그룹의 평균 보상(USD)은 동일합니다.

$H_{A}$: 어릴 때 코딩을 시작한 그룹의 평균 보상(USD)이 성인이 된 후 시작한 그룹보다 높습니다.

 

우측 검정을 사용합니다.

R로 하는 가설 검정

유의수준

$\alpha = 0.1$

$p \le \alpha$이면 $H_{0}$을 기각합니다.

R로 하는 가설 검정

p-값 계산: 단일 비율과 기준값 비교

p_value <- pnorm(z_score, lower.tail = FALSE)
R로 하는 가설 검정

p-값 계산: 두 집단의 평균 비교

numerator <- xbar_child - xbar_adult
denominator <- sqrt(s_child ^ 2 / n_child + s_adult ^ 2 / n_adult)
t_stat <- numerator / denominator
2.4046
degrees_of_freedom <- n_child + n_adult - 2
2578
  • 검정 통계량 표준 오차는 근사값(부트스트래핑 아님)을 사용합니다.
  • 정규 분포 CDF 대신 t-분포 CDF를 사용합니다.
p_value <- pt(t_stat, df = degrees_of_freedom, lower.tail = FALSE)
0.008130
R로 하는 가설 검정

연습해 봅시다!

R로 하는 가설 검정

Preparing Video For Download...