표집과 점추정

R에서의 표본추출

Richie Cotton

Data Evangelist at DataCamp

프랑스 인구 추정

프랑스 지도.

인구조사는 모든 가구에 거주 인원을 묻습니다.

R에서의 표본추출

프랑스에는 사람이 많습니다

사람 아이콘이 있는 프랑스 지도.

인구조사는 매우 비쌉니다!

R에서의 표본추출

가구 표집

일부 사람이 강조된 프랑스 지도.

소수의 가구만 조사하고 통계를 사용해 전체 모집단을 추정하는 것이 더 저렴합니다.

전체의 하위 집합으로 작업하는 것을 표집이라고 합니다.

R에서의 표본추출

모집단 vs. 표본

모집단은 전체 데이터셋입니다.

  • 꼭 사람을 뜻하지는 않습니다.
  • 전체 모집단을 아는 경우는 드뭅니다.

표본은 계산에 사용하는 데이터의 부분집합입니다.

R에서의 표본추출

커피 평점 데이터셋

total_cup_points variety country_of_origin aroma flavor aftertaste body balance
90.58 NA Ethiopia 8.67 8.83 8.67 8.50 8.42
89.92 Other Ethiopia 8.75 8.67 8.50 8.42 8.42
... ... ... ... ... ... ... ...
73.75 NA Vietnam 6.75 6.67 6.5 6.92 6.83
  • 각 행은 커피 1개를 나타냅니다.
  • 1138행.
  • 이를 모집단으로 간주하겠습니다.
R에서의 표본추출

점수 vs. 풍미: 모집단

pts_vs_flavor_pop <- coffee_ratings %>% 
  select(total_cup_points, flavor)
dim(pts_vs_flavor_pop)
1338    2
     total_cup_points flavor
1               90.58   8.83
2               89.92   8.67
3               89.75   8.50
4               89.00   8.58
...              ...     ...
1335            78.08   7.67
1336            77.17   7.33
1337            75.08   6.83
1338            73.75   6.67
R에서의 표본추출

점수 vs. 풍미: 10행 표본

pts_vs_flavor_samp <- coffee_ratings %>% 
  select(total_cup_points, flavor) %>%
  slice_sample(n = 10)
dim(pts_vs_flavor_samp)
10  2
   total_cup_points flavor
1             82.25   7.58
2             83.50   7.67
3             80.50   7.17
4             79.33   7.17
5             83.83   7.58
6             84.17   7.75
7             83.67   8.17
8             81.92   7.50
9             82.67   7.58
10            83.42   7.67
R에서의 표본추출

Base R 표집

데이터 프레임에는 slice_sample()을, 벡터에는 sample()을 사용합니다.

cup_points_samp <- sample(coffee_ratings$total_cup_points, size = 10)
88.25 83.83 83.17 82.67 84.67 83.42 73.67 86.00 81.58 80.92
R에서의 표본추출

모집단 모수와 점추정

모집단 모수는 모집단 데이터셋으로 계산한 값입니다.

mean(pts_vs_flavor_pop$total_cup_points)
82.15

점추정(또는 표본 통계량)은 표본 데이터셋으로 계산한 값입니다.

mean(cup_points_samp)
82.82
R에서의 표본추출

dplyr로 점추정 구하기

pts_vs_flavor_pop %>% 
  summarize(mean_flavor = mean(flavor)) 
  mean_flavor
1       7.526
pts_vs_flavor_samp %>% 
  summarize(mean_flavor = mean(flavor)) 
  mean_flavor
1       7.716
R에서의 표본추출

Vamos praticar!

R에서의 표본추출

Preparing Video For Download...