표본추출과 점추정

Python으로 살펴보는 표본추출(Sampling)

James Chapman

Curriculum Manager, DataCamp

프랑스 인구 추정하기

프랑스 지도.

인구조사는 각 가구에 거주 인원을 묻습니다.

Python으로 살펴보는 표본추출(Sampling)

프랑스엔 사람이 많습니다

사람 아이콘이 있는 프랑스 지도.

인구조사는 비용이 매우 큽니다!

Python으로 살펴보는 표본추출(Sampling)

가구 표본추출

일부가 하이라이트된 사람 아이콘이 있는 프랑스 지도.

소수의 가구만 조사하고 통계로 전체를 추정하는 것이 더 저렴합니다

전체에서 일부만 다루는 것을 표본추출이라 합니다

Python으로 살펴보는 표본추출(Sampling)

모집단 vs. 표본

모집단은 전체 데이터셋입니다

  • 사람을 가리킬 필요는 없습니다
  • 전체 모집단을 모르는 경우가 많습니다

 

표본은 계산에 사용하는 데이터의 부분집합입니다

Python으로 살펴보는 표본추출(Sampling)

커피 평점 데이터셋

total_cup_points variety country_of_origin aroma flavor aftertaste body balance
90.58 NA Ethiopia 8.67 8.83 8.67 8.50 8.42
89.92 Other Ethiopia 8.75 8.67 8.50 8.42 8.42
... ... ... ... ... ... ... ...
73.75 NA Vietnam 6.75 6.67 6.5 6.92 6.83

 

  • 각 행은 커피 1개를 의미합니다
  • 1338행
  • 이를 모집단으로 간주합니다
Python으로 살펴보는 표본추출(Sampling)

총점 vs. 풍미: 모집단

pts_vs_flavor_pop = coffee_ratings[["total_cup_points", "flavor"]]
      total_cup_points  flavor
0                90.58    8.83
1                89.92    8.67
2                89.75    8.50
3                89.00    8.58
4                88.83    8.50
...                ...     ...
1333             78.75    7.58
1334             78.08    7.67
1335             77.17    7.33
1336             75.08    6.83
1337             73.75    6.67

[1338 rows x 2 columns]
Python으로 살펴보는 표본추출(Sampling)

총점 vs. 풍미: 10행 표본

pts_vs_flavor_samp = pts_vs_flavor_pop.sample(n=10)
      total_cup_points  flavor
1088             80.33    7.17
1157             79.67    7.42
1267             76.17    7.33
506              83.00    7.67
659              82.50    7.42
817              81.92    7.50
1050             80.67    7.42
685              82.42    7.50
1027             80.92    7.25
62               85.58    8.17

[10 rows x 2 columns]
Python으로 살펴보는 표본추출(Sampling)

Series에서의 파이썬 표본추출

  • pandas DataFrame과 Series에는 .sample()을 사용합니다
cup_points_samp = coffee_ratings['total_cup_points'].sample(n=10)
1088    80.33
1157    79.67
1267    76.17
...     ... 
685     82.42
1027    80.92
62      85.58
Name: total_cup_points, dtype: float64
Python으로 살펴보는 표본추출(Sampling)

모집단 모수와 점추정

모집단 모수는 모집단 데이터셋으로 계산한 값입니다

import numpy as np
np.mean(pts_vs_flavor_pop['total_cup_points'])
82.15120328849028

점추정(또는 표본 통계량)은 표본 데이터셋으로 계산한 값입니다

np.mean(cup_points_samp)
81.31800000000001
Python으로 살펴보는 표본추출(Sampling)

pandas로 점추정하기

pts_vs_flavor_pop['flavor'].mean()
7.526046337817639
pts_vs_flavor_samp['flavor'].mean()
7.485000000000001
Python으로 살펴보는 표본추출(Sampling)

Ayo berlatih!

Python으로 살펴보는 표본추출(Sampling)

Preparing Video For Download...