가설 검정의 가정

Python으로 배우는 가설 검정

James Chapman

Curriculum Manager, DataCamp

무작위성

가정

표본은 더 큰 모집단의 무작위 부분 집합입니다

결과
  • 표본이 모집단을 대표하지 못함
확인 방법
  • 데이터 수집 방법 파악
  • 데이터 수집자/도메인 전문가와 상담

"책임감 있는 원재료 조달"이라는 문구가 있는 로고.

1 표본 추출 기법은 "Sampling in Python"에서 다룹니다.
Python으로 배우는 가설 검정

관측값의 독립성

가정

데이터셋의 각 관측값(행)은 독립적입니다

결과
  • 거짓 음성/양성 오류 가능성 증가
확인 방법
  • 데이터 수집 방법 파악
Python으로 배우는 가설 검정

충분한 표본 크기

가정

중심극한정리가 적용될 수 있도록 표본이 충분히 커야 합니다

결과
  • 신뢰 구간 확대
  • 거짓 음성/양성 오류 가능성 증가
확인 방법
  • 검정 유형에 따라 다름
Python으로 배우는 가설 검정

충분한 표본 크기: t-검정

단일 표본
  • 표본에 관측값이 30개 이상

$n \ge 30$

$n$: 표본 크기

두 표본
  • 각 표본에 관측값이 30개 이상

$n_{1} \ge 30, n_{2} \ge 30$

$n_{i}$: 집단 $i$의 표본 크기

대응 표본
  • 표본 전체에서 관측값 쌍이 30개 이상

데이터의 행 수 $\ge 30$

ANOVA
  • 각 표본에 관측값이 30개 이상

$n_{i} \ge 30$ (모든 $i$에 대해)

Python으로 배우는 가설 검정

충분한 표본 크기: 비율 검정

단일 표본
  • 표본의 성공 횟수가 10 이상

$n \times \hat{p} \ge 10$

  • 표본의 실패 횟수가 10 이상

$n \times (1 - \hat{p}) \ge 10$

$n$: 표본 크기
$\hat{p}$: 표본 성공 비율

두 표본
  • 각 표본의 성공 횟수가 10 이상

$n_{1} \times \hat{p}_{1} \ge 10$

$n_{2} \times \hat{p}_{2} \ge 10$

  • 각 표본의 실패 횟수가 10 이상

$n_{1} \times (1 - \hat{p}_{1}) \ge 10$

$n_{2} \times (1 - \hat{p}_{2}) \ge 10$

Python으로 배우는 가설 검정

충분한 표본 크기: 카이제곱 검정

  • 각 집단의 성공 횟수가 5 이상

$n_{i} \times \hat{p}_{i} \ge 5$ (모든 $i$에 대해)

  • 각 집단의 실패 횟수가 5 이상

$n_{i} \times (1 - \hat{p}_{i}) \ge 5$ (모든 $i$에 대해)

$n_{i}$: 집단 $i$의 표본 크기
$\hat{p}_{i}$: 집단 $i$의 표본 성공 비율

Python으로 배우는 가설 검정

검증 확인

부트스트랩 분포가 정규분포처럼 보이지 않으면 가정이 유효하지 않을 수 있습니다

  • 무작위성, 독립성, 표본 크기를 확인하기 위해 데이터 수집 과정을 재검토하세요
Python으로 배우는 가설 검정

연습해 봅시다!

Python으로 배우는 가설 검정

Preparing Video For Download...