Python으로 배우는 가설 검정
James Chapman
Curriculum Manager, DataCamp
age_first_code_cut은 Stack Overflow 사용자가 프로그래밍을 처음 시작한 시기를 분류합니다"adult"는 14세 이상에 시작했음을 의미"child"는 14세 이전에 시작했음을 의미가설은 알 수 없는 모집단 모수에 관한 진술입니다
가설 검정은 두 가지 경쟁 가설을 검정하는 것입니다
귀무 가설($H_{0}$)은 기존의 아이디어입니다
대립 가설($H_{A}$)은 연구자의 새로운 "도전" 아이디어입니다
우리의 문제에 대해:
유의 수준은 가설 검정에서 "합리적 의심의 여지"에 해당합니다

가설 검정은 표본 통계량이 귀무 분포의 꼬리에 위치하는지 확인합니다
| 검정 | 꼬리 |
|---|---|
| 대립 귀무와 다름 | 양측 검정 |
| 대립 귀무보다 큼 | 우측 검정 |
| 대립 귀무보다 작음 | 좌측 검정 |
$H_{A}$: 어린 시절에 프로그래밍을 시작한 데이터 과학자의 비율이 35%보다 큽니다
이는 우측 검정입니다

p-값: 귀무 가설이 참이라는 가정 하에 결과를 얻을 확률
prop_child_samp = (stack_overflow['age_first_code_cut'] == "child").mean()
0.39141972578505085
prop_child_hyp = 0.35
std_error = np.std(first_code_boot_distn, ddof=1)
0.010351057228878566
z_score = (prop_child_samp - prop_child_hyp) / std_error
4.001497129152506
norm.cdf()는 scipy.stats의 정규 CDF입니다.norm.cdf() 사용.1 - norm.cdf() 사용.
from scipy.stats import norm
1 - norm.cdf(z_score, loc=0, scale=1)
3.1471479512323874e-05
Python으로 배우는 가설 검정