중심 극한 정리

R로 시작하는 통계학 입문

Maggie Matsui

Content Developer, DataCamp

주사위 5번 굴리기

die <- c(1, 2, 3, 4, 5, 6)

# Roll 5 times sample_of_5 <- sample(die, 5, replace = TRUE) sample_of_5
1 3 4 1 1
mean(sample_of_5)
2.0

 

6면 주사위

R로 시작하는 통계학 입문

주사위 5번 굴리기

# Roll 5 times and take mean
sample(die, 5, replace = TRUE) %>% mean()
4.4
sample(die, 5, replace = TRUE) %>% mean()
3.8
R로 시작하는 통계학 입문

주사위 5번 굴리기를 10번 반복

10번 반복:

  • 5번 굴리기
  • 평균 구하기

 

sample_means <- replicate(10, sample(die, 5, replace = TRUE) %>% mean())

sample_means
3.8 4.0 3.8 3.6 3.2 4.8 2.6 3.0 2.6 2.0
R로 시작하는 통계학 입문

표집 분포

표본 평균의 표집 분포

10개 표본 평균의 히스토그램

R로 시작하는 통계학 입문

표본 평균 100개

replicate(100, sample(die, 5, replace = TRUE) %>% mean())
2.8 3.2 1.8 4.6 4.0 2.8 4.4 2.4 3.4 2.8 4.2 3.4 ... 2.2 3.8 3.6 3.8 4.4 4.8 2.4

100개 표본 평균의 히스토그램

R로 시작하는 통계학 입문

표본 평균 1000개

sample_means <- replicate(1000, sample(die, 5, replace = TRUE) %>% mean())

1000개 표본 평균의 히스토그램

R로 시작하는 통계학 입문

중심 극한 정리

시행 횟수가 증가할수록 통계량의 표집 분포는 정규 분포에 가까워집니다.

10, 100, 1000개 표본 평균의 히스토그램. 표본 수가 많을수록 종 모양의 분포에 가까워짐

 

* 표본은 무작위이고 독립적이어야 합니다

R로 시작하는 통계학 입문

표준편차와 CLT

replicate(1000, sample(die, 5, replace = TRUE) %>% sd())

주사위 5회 굴리기의 표본 표준편차 1000개 분포

R로 시작하는 통계학 입문

비율과 CLT

sales_team <- c("Amir", "Brian", "Claire", "Damian")

sample(sales_team, 10, replace = TRUE)
"Claire" "Brian"  "Brian"  "Brian"  "Damian" "Damian" "Brian"  "Brian" 
"Amir"   "Amir"
sample(sales_team, 10, replace = TRUE)
"Amir"   "Amir"   "Claire" "Amir"   "Amir"   "Brian"  "Amir"   "Claire" 
"Claire" "Claire"
R로 시작하는 통계학 입문

비율의 표집 분포

표본 비율의 분포도 정규 분포처럼 보임

R로 시작하는 통계학 입문

표집 분포의 평균

# Estimate expected value of die
mean(sample_means)
3.48
# Estimate proportion of "Claire"s
mean(sample_props)
0.26
  • 알 수 없는 모집단 분포의 특성을 추정

중앙에 점선이 그어진 표본 평균의 표집 분포  

  • 대규모 모집단의 특성을 보다 쉽게 추정
R로 시작하는 통계학 입문

연습해 봅시다!

R로 시작하는 통계학 입문

Preparing Video For Download...