중심극한정리

Python으로 시작하는 통계학

Maggie Matsui

Content Developer, DataCamp

주사위 5번 굴리기

die = pd.Series([1, 2, 3, 4, 5, 6])

# Roll 5 times samp_5 = die.sample(5, replace=True) print(samp_5) ```
np.mean(samp_5)
2.0

6면체 주사위

Python으로 시작하는 통계학

주사위 5번 굴리기

# Roll 5 times and take mean
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
4.4
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
3.8
Python으로 시작하는 통계학

주사위 5번 굴리기 10회 반복

10회 반복:

  • 5번 굴리기
  • 평균 구하기
sample_means = []

for i in range(10):
samp_5 = die.sample(5, replace=True) sample_means.append(np.mean(samp_5))
print(sample_means)
[3.8, 4.0, 3.8, 3.6, 3.2, 4.8, 2.6,
3.0, 2.6, 2.0]
Python으로 시작하는 통계학

표본분포

표본평균의 표본분포

표본평균 10개의 히스토그램

Python으로 시작하는 통계학

표본평균 100개

sample_means = []
for i in range(100):
    sample_means.append(np.mean(die.sample(5, replace=True)))

100개 표본평균의 히스토그램

Python으로 시작하는 통계학

표본평균 1000개

sample_means = []
for i in range(1000):
    sample_means.append(np.mean(die.sample(5, replace=True)))

1000개 표본평균의 히스토그램

Python으로 시작하는 통계학

중심극한정리

시행 횟수가 늘어날수록 통계량의 표본분포는 정규분포에 가까워짐.

표본평균 10개, 100개, 1000개의 히스토그램, 표본평균 수가 많을수록 분포가 더 종 모양 곡선에 가까워짐

* 표본은 무작위이며 서로 독립적이어야 합니다

Python으로 시작하는 통계학

표준편차와 중심극한정리

sample_sds = []
for i in range(1000):
  sample_sds.append(np.std(die.sample(5, replace=True)))

주사위를 5번 굴려 얻은 표본 표준편차 1000개의 분포

Python으로 시작하는 통계학

비율과 중심극한정리

sales_team = pd.Series(["Amir", "Brian", "Claire", "Damian"])

sales_team.sample(10, replace=True)
array(['Claire', 'Damian', 'Brian', 'Damian', 'Damian', 'Amir', 'Amir', 'Amir', 
      'Amir', 'Damian'], dtype=object)
sales_team.sample(10, replace=True)
```  

Python으로 시작하는 통계학

비율의 표본분포

표본 비율의 분포도 정규분포처럼 보임

Python으로 시작하는 통계학

표본분포의 평균

# Estimate expected value of die
np.mean(sample_means)
3.48
# Estimate proportion of "Claire"s
np.mean(sample_props)
```  

가운데 점선이 있는 표본평균의 표집분포

  • 알 수 없는 기저 분포의 특성 추정
  • 큰 모집단의 특성을 더 쉽게 추정
Python으로 시작하는 통계학

연습해 봅시다!

Python으로 시작하는 통계학

Preparing Video For Download...