신뢰 구간

Python으로 살펴보는 표본추출(Sampling)

James Chapman

Curriculum Manager, DataCamp

신뢰 구간

  • "평균에서 1 표준편차 이내의 값"은 각 분포에서 많은 값을 포함합니다
  • 관련 개념인 신뢰구간을 정의하겠습니다
Python으로 살펴보는 표본추출(Sampling)

날씨 예측하기

  • 미국 사우스다코타주 래피드시티는 날씨 예측이 가장 어렵습니다
  • 내일 그곳의 최고기온을 예측합니다

지역별 예측 가능성을 색으로 나타낸 일기예보 지도.

Python으로 살펴보는 표본추출(Sampling)

예측 결과

  • 점추정치 = 47°F (8.3°C)
  • 그럴듯한 최고기온 범위 = 40~54°F (4.4~12.8°C)
Python으로 살펴보는 표본추출(Sampling)

방금 신뢰구간을 보고했습니다!

  • 40~54°F는 신뢰구간입니다
  • 47°F (40°F, 54°F) 또는 47°F [40°F, 54°F]처럼 표기하기도 합니다
  • 또는 47 ± 7°F
  • 7°F는 허용오차(오차 한계)입니다
Python으로 살펴보는 표본추출(Sampling)

평균 풍미의 부트스트랩 분포

import matplotlib.pyplot as plt
plt.hist(coffee_boot_distn, bins=15)
plt.show()

평균 커피 풍미의 히스토그램.

Python으로 살펴보는 표본추출(Sampling)

재표본 평균

import numpy as np
np.mean(coffee_boot_distn)
7.513452892

세로 검은 막대로 평균이 표시된 평균 커피 풍미의 히스토그램.

Python으로 살펴보는 표본추출(Sampling)

평균 ± 1 표준편차

np.mean(coffee_boot_distn)
7.513452892
np.mean(coffee_boot_distn) - np.std(coffee_boot_distn, ddof=1)
7.497385709174466
np.mean(coffee_boot_distn) + np.std(coffee_boot_distn, ddof=1)
7.529520074825534

평균과 표준편차가 세로 막대로 표시된 커피 풍미 평균의 히스토그램.

Python으로 살펴보는 표본추출(Sampling)

신뢰구간의 분위수 방법

np.quantile(coffee_boot_distn, 0.025)
7.4817195
np.quantile(coffee_boot_distn, 0.975)
7.5448805

95% 신뢰구간 선.

Python으로 살펴보는 표본추출(Sampling)

역 누적분포함수

  • PDF: 종 모양 곡선
  • CDF: 적분하여 곡선 아래 면적 구함
  • 역 CDF: x, y 축을 뒤바꿈

Python 구현

from scipy.stats import norm
norm.ppf(quantile, loc=0, scale=1)

역 누적분포함수.

Python으로 살펴보는 표본추출(Sampling)

표준오차 기반 신뢰구간

point_estimate = np.mean(coffee_boot_distn)
7.513452892
std_error = np.std(coffee_boot_distn, ddof=1)
0.016067182825533724
from scipy.stats import norm
lower = norm.ppf(0.025, loc=point_estimate, scale=std_error)
upper = norm.ppf(0.975, loc=point_estimate, scale=std_error)
print((lower, upper))
(7.481961792328933, 7.544943991671067)
Python으로 살펴보는 표본추출(Sampling)

연습해 봅시다!

Python으로 살펴보는 표본추출(Sampling)

Preparing Video For Download...