편의 표본추출

Python으로 살펴보는 표본추출(Sampling)

James Chapman

Curriculum Manager, DataCamp

The Literary Digest의 선거 예측

1936년 The Literary Digest 1면. 선거 예측 헤드라인: 랜던 130만 표, 루스벨트 약 100만 표.

  • 예측: 랜던 57%, 루스벨트 43%
  • 실제: 랜던 38%, 루스벨트 62%
  • 표본이 모집단을 대변하지 않아 표본 편향 발생
  • 가장 쉬운 방법으로 수집하는 것을 편의 표본추출이라 함
Python으로 살펴보는 표본추출(Sampling)

프랑스인의 평균 나이 구하기

디즈니랜드 파리 사진.

  • 디즈니랜드 파리에서 10명 설문
  • 평균 나이 24.6세
  • 프랑스 전체의 좋은 추정치가 될까?
1 Image by Sean MacEntee
Python으로 살펴보는 표본추출(Sampling)

설문은 얼마나 정확했나?

연도 프랑스 평균 나이
1975 31.6
1985 33.6
1995 36.2
2005 38.9
2015 41.2
  • 24.6세는 부정확한 추정치
  • 디즈니 방문객은 전체 인구를 대변하지 않음
Python으로 살펴보는 표본추출(Sampling)

편의 표본추출: 커피 평점

coffee_ratings["total_cup_points"].mean()
82.15120328849028
coffee_ratings_first10 = coffee_ratings.head(10)
coffee_ratings_first10["total_cup_points"].mean()
89.1
Python으로 살펴보는 표본추출(Sampling)

선택 편향 시각화

import matplotlib.pyplot as plt
import numpy as np
coffee_ratings["total_cup_points"].hist(bins=np.arange(59, 93, 2))
plt.show()

 

coffee_ratings_first10["total_cup_points"].hist(bins=np.arange(59, 93, 2))
plt.show()
Python으로 살펴보는 표본추출(Sampling)

모집단 vs 편의 표본의 분포

모집단: 모집단의 컵 포인트 히스토그램.

편의 표본: 표본의 컵 포인트 히스토그램.

Python으로 살펴보는 표본추출(Sampling)

무작위 표본에서의 선택 편향 시각화

coffee_sample = coffee_ratings.sample(n=10)
coffee_sample["total_cup_points"].hist(bins=np.arange(59, 93, 2))
plt.show()
Python으로 살펴보는 표본추출(Sampling)

모집단 vs 단순무작위표본의 분포

모집단: 모집단의 컵 포인트 히스토그램.

단순무작위표본: 무작위 표본의 컵 포인트 히스토그램.

Python으로 살펴보는 표본추출(Sampling)

연습해 봅시다!

Python으로 살펴보는 표본추출(Sampling)

Preparing Video For Download...