군집 표집

Python으로 살펴보는 표본추출(Sampling)

James Chapman

Curriculum Manager, DataCamp

층화 표집 vs. 군집 표집

층화 표집

  • 모집단을 하위 집단으로 나눕니다
  • 각 하위 집단에서 단순 임의 표집을 수행합니다

군집 표집

  • 일부 하위 집단을 단순 임의 표집으로 선택합니다
  • 선택된 하위 집단에서만 단순 임의 표집을 수행합니다
Python으로 살펴보는 표본추출(Sampling)

커피 품종

행과 열로 배열된 커피 원두.

varieties_pop = list(coffee_ratings['variety'].unique())
[None, 'Other', 'Bourbon', 'Catimor', 
'Ethiopian Yirgacheffe','Caturra', 
'SL14', 'Sumatra', 'SL34', 'Hawaiian Kona',
'Yellow Bourbon', 'SL28', 'Gesha', 'Catuai',
'Pacamara', 'Typica', 'Sumatra Lintong',
'Mundo Novo', 'Java', 'Peaberry', 'Pacas',
'Mandheling', 'Ruiru 11', 'Arusha',
'Ethiopian Heirlooms', 'Moka Peaberry',
'Sulawesi', 'Blue Mountain', 'Marigojipe', 
'Pache Comun']
Python으로 살펴보는 표본추출(Sampling)

1단계: 하위 집단 표집

행과 열로 배열된 커피 원두, 그중 세 개만 강조됨.

import random
varieties_samp = random.sample(varieties_pop, k=3)
['Hawaiian Kona', 'Bourbon', 'SL28']
Python으로 살펴보는 표본추출(Sampling)

2단계: 각 집단에서 표집

variety_condition = coffee_ratings['variety'].isin(varieties_samp)
coffee_ratings_cluster = coffee_ratings[variety_condition]
coffee_ratings_cluster['variety'] = coffee_ratings_cluster['variety'].cat.remove_unused_categories()
coffee_ratings_cluster.groupby("variety")\
    .sample(n=5, random_state=2021)
Python으로 살펴보는 표본추출(Sampling)

2단계 출력

                    total_cup_points        variety       country_of_origin  ...
variety                                                                       
Bourbon       575              82.83        Bourbon               Guatemala   
              560              82.83        Bourbon               Guatemala   
              524              83.00        Bourbon               Guatemala   
              1140             79.83        Bourbon               Guatemala   
              318              83.67        Bourbon                  Brazil   
Hawaiian Kona 1291             73.67  Hawaiian Kona  United States (Hawaii)   
              1266             76.25  Hawaiian Kona  United States (Hawaii)   
              488              83.08  Hawaiian Kona  United States (Hawaii)   
              461              83.17  Hawaiian Kona  United States (Hawaii)   
              117              84.83  Hawaiian Kona  United States (Hawaii)   
SL28          137              84.67           SL28                   Kenya   
              452              83.17           SL28                   Kenya   
              224              84.17           SL28                   Kenya   
              66               85.50           SL28                   Kenya   
              559              82.83           SL28                   Kenya   
Python으로 살펴보는 표본추출(Sampling)

다단계 표집

  • 군집 표집은 다단계 표집의 한 종류입니다
  • 단계는 2단계 초과 가능
  • 예: 전국 조사에서 주→군→시→동/읍/면을 표집
Python으로 살펴보는 표본추출(Sampling)

연습해 봅시다!

Python으로 살펴보는 표본추출(Sampling)

Preparing Video For Download...