정규성 검정

Python에서 배우는 추론 통계 기초

Paul Savala

Assistant Professor of Mathematics

미국 남성의 키

대략 정규분포 형태의 히스토그램. 평균 키 180cm, 최소 160cm, 최대 200cm.

Python에서 배우는 추론 통계 기초

모형 잔차

산점도: x축 근속연수, y축 연봉, 전반적으로 양의 선형 추세. 적색 추세선 포함.

예측선 위·아래에 잔차가 균등하게 분포해야 함

Python에서 배우는 추론 통계 기초

모형 잔차

히스토그램: x축 "residual (error)", y축 "count". 이봉분포로, 약 -10,000과 +30,000 부근에 봉우리가 있음.

Python에서 배우는 추론 통계 기초

정규분포의 활용

  • 모수적 검정: 정규성을 가정하는 가설검정
  • 평균 비교 t-검정:
    • 표본평균이 정규분포한다고 가정
    • 아니면 결론이 유효하지 않음
Python에서 배우는 추론 통계 기초

히스토그램: x축 6만~9만5천 달러 연봉, y축 빈도. 정규분포에 비교적 가깝음.

Python에서 배우는 추론 통계 기초

Anderson-Darling 정규성 검정

  • 정규성 가정을 검정합니다

$H_0$: 데이터는 정규분포를 따름

$H_a$: 데이터는 정규분포를 따르지 않음

Python에서 배우는 추론 통계 기초

SciPy의 Anderson-Darling 검정

result = stats.anderson(police_df['Annual Salary'])

result.statistic
27.41
result.critical_values
[0.574, 0.654, 0.784, 0.915, 1.088]
result.significance_level[result.statistic > result.critical_values]
[15.  10.   5.   2.5  1. ]
Python에서 배우는 추론 통계 기초

정규분포 적합하기

mu, std = stats.norm.fit(police_df['Annual Salary'])

estimated_pct_under_70k = stats.norm.cdf(70000, loc=mu, scale=std)
print(estimated_pct_under_70k)
0.27
actual_under_70k = police_df[police_df['Annual Salary'] < 70000]

print(len(actual_under_70k) / len(police_df))
0.20
Python에서 배우는 추론 통계 기초

연습해 봅시다!

Python에서 배우는 추론 통계 기초

Preparing Video For Download...