통계적 유의성

Python으로 배우는 가설 검정

James Chapman

Curriculum Manager, DataCamp

p값 복습

  • p값은 귀무 가설에 대한 증거를 수치화합니다
  • 큰 p값 → 귀무 가설 기각 실패
  • 작은 p값 → 귀무 가설 기각
  • 기준점은 어디인가요?
Python으로 배우는 가설 검정

유의 수준

가설 검정의 유의 수준 ($\alpha$)은 "합리적 의심의 여지 없음"에 대한 기준 임계값입니다

  • $\alpha$의 일반적인 값: 0.2, 0.1, 0.05, 0.01
  • $p \le \alpha$이면 $H_{0}$ 기각, 아니면 기각하지 않음
  • $\alpha$는 가설 검정 수행 전에 설정해야 합니다
Python으로 배우는 가설 검정

p값 계산

alpha = 0.05

prop_child_samp = (stack_overflow['age_first_code_cut'] == "child").mean() prop_child_hyp = 0.35
std_error = np.std(first_code_boot_distn, ddof=1)
z_score = (prop_child_samp - prop_child_hyp) / std_error
p_value = 1 - norm.cdf(z_score, loc=0, scale=1)
3.1471479512323874e-05
Python으로 배우는 가설 검정

의사 결정

alpha = 0.05

print(p_value)
3.1471479512323874e-05
p_value <= alpha
True

$H_{A}$를 지지하여 $H_{0}$ 기각

Python으로 배우는 가설 검정

신뢰 구간

유의 수준 $\alpha$에 대해 신뢰 구간 수준은 1 - $\alpha$로 설정하는 것이 일반적입니다

  • $\alpha=0.05$ → $95\%$ 신뢰 구간
import numpy as np
lower = np.quantile(first_code_boot_distn, 0.025)
upper = np.quantile(first_code_boot_distn, 0.975)
print((lower, upper))
(0.37063246351172047, 0.41132242370632466)
Python으로 배우는 가설 검정

오류의 종류

실제로 범죄를 저지르지 않음 실제로 범죄를 저지름
무죄 판결 올바름 처벌을 피함
유죄 판결 억울한 유죄 올바름

 

실제 $H_{0}$ 실제 $H_{A}$
선택된 $H_{0}$ 올바름 거짓 음성
선택된 $H_{A}$ 거짓 양성 올바름

 

거짓 양성은 1종 오류, 거짓 음성은 2종 오류입니다.

Python으로 배우는 가설 검정

예시에서 발생 가능한 오류

$p \le \alpha$이면 $H_{0}$를 기각합니다:

  • 거짓 양성(1종) 오류: 데이터 과학자들이 어린 시절에 코딩을 시작한 비율이 더 높지 않음

$p \gt \alpha$이면 $H_{0}$를 기각하지 않습니다:

  • 거짓 음성(2종) 오류: 데이터 과학자들이 어린 시절에 코딩을 시작한 비율이 더 높음
Python으로 배우는 가설 검정

연습해 봅시다!

Python으로 배우는 가설 검정

Preparing Video For Download...