t-검정 수행

R로 하는 가설 검정

Richie Cotton

Data Evangelist at DataCamp

두 표본 문제

  • 변수의 그룹 간 표본 통계량을 비교하는 문제입니다.
  • converted_comp는 수치형 변수입니다.
  • age_first_code_cut은 범주형 변수로 ("child""adult") 수준을 가집니다.
  • 어릴 때 처음 프로그래밍을 시작한 사용자가 성인 때 시작한 사용자보다 연봉이 높은 경향이 있을까요?
R로 하는 가설 검정

가설

$H_{0}$: 어릴 때 처음 코딩한 사람과 성인 때 처음 코딩한 사람의 평균 연봉(USD)은 동일하다.

$H_{0}$: $\mu_{child} = \mu_{adult}$

$H_{0}$: $\mu_{child} - \mu_{adult} = 0$

$H_{A}$: 어릴 때 처음 코딩한 사람의 평균 연봉(USD)이 성인 때 처음 코딩한 사람보다 더 높다.

$H_{A}$: $\mu_{child} > \mu_{adult}$

$H_{A}$: $\mu_{child} - \mu_{adult} > 0$

R로 하는 가설 검정

그룹별 요약 통계량 계산

stack_overflow %>% 
  group_by(age_first_code_cut) %>% 
  summarize(mean_compensation = mean(converted_comp))
# A tibble: 2 x 2
  age_first_code_cut mean_compensation
  <chr>                          <dbl>
1 adult                        111544.
2 child                        138275.
R로 하는 가설 검정

검정 통계량

  • 표본 평균은 모집단 평균을 추정합니다.
  • $\bar{x}$는 표본 평균을 나타냅니다.
  • $\bar{x}_{child}$는 어릴 때 처음 코딩한 그룹의 표본 평균 연봉입니다.
  • $\bar{x}_{adult}$는 성인 때 처음 코딩한 그룹의 표본 평균 연봉입니다.
  • $\bar{x}_{child} - \bar{x}_{adult}$는 검정 통계량입니다.
  • z-점수는 (표준화된) 검정 통계량의 한 유형입니다.
R로 하는 가설 검정

검정 통계량 표준화

$z = \dfrac{\text{표본 통계량} - \text{모집단 모수}}{\text{표준오차}}$

$t = \dfrac{\text{표본 통계량의 차이} - \text{모집단 모수의 차이}}{\text{표준오차}}$

$t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}}) - (\mu_{\text{child}} - \mu_{\text{adult}})}{SE(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}$

R로 하는 가설 검정

표준오차

$SE(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}}) \approx \sqrt{\dfrac{s_{\text{child}}^2}{n_{\text{child}}} + \dfrac{s_{\text{adult}}^2}{n_{\text{adult}}}}$

$s$는 변수의 표준편차입니다.

$n$은 표본 크기(표본의 관측값/행 수)입니다.

R로 하는 가설 검정

귀무가설이 참이라고 가정

$t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}}) - (\mu_{\text{child}} - \mu_{\text{adult}})}{SE(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}$

$H_{0}$: $\mu_{\text{child}} - \mu_{\text{adult}} = 0$

$t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}}) }{SE(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}$

$t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}{\sqrt{\dfrac{s_{\text{child}}^2}{n_{\text{child}}} + \dfrac{s_{\text{adult}}^2}{n_{\text{adult}}}}}$

stack_overflow %>%
  group_by(age_first_code_cut) %>%
  summarize(
    xbar = mean(converted_comp),
    s = sd(converted_comp),
    n = n()
  )
# A tibble: 2 x 4
  age_first_code_cut    xbar       s     n
  <chr>                <dbl>   <dbl> <int>
1 adult              111544. 270381.  1579
2 child              138275. 278130.  1001
R로 하는 가설 검정

검정 통계량 계산

# A tibble: 2 x 4
  age_first_code_cut    xbar       s     n
  <chr>                <dbl>   <dbl> <int>
1 adult              111544. 270381.  1579
2 child              138275. 278130.  1001

$t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}{\sqrt{\dfrac{s_{\text{child}}^2}{n_{\text{child}}} + \dfrac{s_{\text{adult}}^2}{n_{\text{adult}}}}}$

numerator <- xbar_child - xbar_adult
denominator <- sqrt(
  s_child ^ 2 / n_child + s_adult ^ 2 / n_adult
)
t_stat <- numerator / denominator
2.4046
R로 하는 가설 검정

연습해 봅시다!

R로 하는 가설 검정

Preparing Video For Download...