R로 하는 가설 검정
Richie Cotton
Data Evangelist at DataCamp
age_first_code_cut은 Stack Overflow 사용자가 처음 프로그래밍을 시작한 시기를 분류합니다."adult"는 14세 이상에 시작했음을 의미합니다."child"는 14세 미만에 시작했음을 의미합니다.가설은 알려지지 않은 모집단 모수에 대한 진술입니다.
가설 검정은 두 경쟁 가설을 검정하는 것입니다.
귀무가설($H_{0}$)은 기존의 "대표" 아이디어입니다.
대립가설($H_{A}$)은 연구자의 새로운 "도전자" 아이디어입니다.
이 문제에서
유의 수준은 가설 검정에서의 "합리적 의심의 여지 없이"에 해당합니다.

가설 검정은 표본 통계량이 귀무 분포의 꼬리 부분에 위치하는지를 판단합니다.
| 검정 | 꼬리 |
|---|---|
| 대립가설이 귀무가설과 다를 때 | 양측 검정 |
| 대립가설이 귀무가설보다 클 때 | 우측 검정 |
| 대립가설이 귀무가설보다 작을 때 | 좌측 검정 |
$H_{A}$: 어린 시절에 프로그래밍을 시작한 데이터 과학자의 비율이 35%보다 크다.
대립가설이 "크다"를 사용하므로 우측 검정이 필요합니다.
p-값은
귀무가설이 참이라는 가정 하에,
원래 표본에서 관측된 값과
같거나 더 극단적인 검정 통계량이
관측될 확률입니다.
prop_child_samp <- stack_overflow %>%
summarize(point_estimate = mean(age_first_code_cut == "child")) %>%
pull(point_estimate)
0.388
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
3.956
pnorm()은 정규 CDF입니다.lower.tail = TRUE 사용.lower.tail = FALSE 설정.
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
R로 하는 가설 검정