R에서의 표본추출
Richie Cotton
Data Evangelist at DataCamp

인구조사는 모든 가구에 거주 인원을 묻습니다.

인구조사는 매우 비쌉니다!

소수의 가구만 조사하고 통계를 사용해 전체 모집단을 추정하는 것이 더 저렴합니다.
전체의 하위 집합으로 작업하는 것을 표집이라고 합니다.
모집단은 전체 데이터셋입니다.
표본은 계산에 사용하는 데이터의 부분집합입니다.
| total_cup_points | variety | country_of_origin | aroma | flavor | aftertaste | body | balance |
|---|---|---|---|---|---|---|---|
| 90.58 | NA | Ethiopia | 8.67 | 8.83 | 8.67 | 8.50 | 8.42 |
| 89.92 | Other | Ethiopia | 8.75 | 8.67 | 8.50 | 8.42 | 8.42 |
| ... | ... | ... | ... | ... | ... | ... | ... |
| 73.75 | NA | Vietnam | 6.75 | 6.67 | 6.5 | 6.92 | 6.83 |
pts_vs_flavor_pop <- coffee_ratings %>%
select(total_cup_points, flavor)
dim(pts_vs_flavor_pop)
1338 2
total_cup_points flavor
1 90.58 8.83
2 89.92 8.67
3 89.75 8.50
4 89.00 8.58
... ... ...
1335 78.08 7.67
1336 77.17 7.33
1337 75.08 6.83
1338 73.75 6.67
pts_vs_flavor_samp <- coffee_ratings %>%
select(total_cup_points, flavor) %>%
slice_sample(n = 10)
dim(pts_vs_flavor_samp)
10 2
total_cup_points flavor
1 82.25 7.58
2 83.50 7.67
3 80.50 7.17
4 79.33 7.17
5 83.83 7.58
6 84.17 7.75
7 83.67 8.17
8 81.92 7.50
9 82.67 7.58
10 83.42 7.67
데이터 프레임에는 slice_sample()을, 벡터에는 sample()을 사용합니다.
cup_points_samp <- sample(coffee_ratings$total_cup_points, size = 10)
88.25 83.83 83.17 82.67 84.67 83.42 73.67 86.00 81.58 80.92
모집단 모수는 모집단 데이터셋으로 계산한 값입니다.
mean(pts_vs_flavor_pop$total_cup_points)
82.15
점추정(또는 표본 통계량)은 표본 데이터셋으로 계산한 값입니다.
mean(cup_points_samp)
82.82
pts_vs_flavor_pop %>%
summarize(mean_flavor = mean(flavor))
mean_flavor
1 7.526
pts_vs_flavor_samp %>%
summarize(mean_flavor = mean(flavor))
mean_flavor
1 7.716
R에서의 표본추출