Python으로 배우는 가설 검정
James Chapman
Curriculum Manager, DataCamp
$p$: 모비율 (미지의 모수)
$\hat{p}$: 표본 비율 (표본 통계량)
$p_{0}$: 가설적 모비율
$$ z = \frac{\hat{p} - \text{mean}(\hat{p})}{\text{SE}(\hat{p})} = \frac{\hat{p} - p}{\text{SE}(\hat{p})} $$
$H_{0}$가 참이면 $p = p_{0}$이므로
$$ z = \dfrac{\hat{p} - p_{0}}{\text{SE}(\hat{p})} $$
$SE_{\hat{p}} = \sqrt{\dfrac{p_{0}*(1-p_{0})}{n}}$ $\rightarrow$ $H_0$ 하에서 $SE_{\hat{p}}$는 가설적 $p_0$와 표본 크기 $n$에 의존
$H_{0}$가 참이면,
$z = \dfrac{\hat{p} - p_{0}}{\sqrt{\dfrac{p_{0}*(1-p_{0})}{n}}}$
$t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}{\sqrt{\dfrac{s_{\text{child}}^2}{n_{\text{child}}} + \dfrac{s_{\text{adult}}^2}{n_{\text{adult}}}}}$
$H_{0}$: 30세 미만 Stack Overflow 사용자 비율 $=0.5$
$H_{A}$: 30세 미만 Stack Overflow 사용자 비율 $\neq0.5$
alpha = 0.01
stack_overflow['age_cat'].value_counts(normalize=True)
Under 30 0.535604
At least 30 0.464396
Name: age_cat, dtype: float64
p_hat = (stack_overflow['age_cat'] == 'Under 30').mean()
0.5356037151702786
p_0 = 0.50
n = len(stack_overflow)
2261
$z = \dfrac{\hat{p} - p_{0}}{\sqrt{\dfrac{p_{0}*(1-p_{0})}{n}}}$
import numpy as np
numerator = p_hat - p_0
denominator = np.sqrt(p_0 * (1 - p_0) / n)
z_score = numerator / denominator
3.385911440783663
왼쪽 꼬리 ("미만"):
from scipy.stats import norm
p_value = norm.cdf(z_score)
오른쪽 꼬리 ("초과"):
p_value = 1 - norm.cdf(z_score)
양측 ("같지 않음"):
p_value = norm.cdf(-z_score) +
1 - norm.cdf(z_score)
p_value = 2 * (1 - norm.cdf(z_score))
0.0007094227368100725
p_value <= alpha
True
Python으로 배우는 가설 검정