Vzorkování a bodové odhady

Vzorkování v R

Richie Cotton

Data Evangelist at DataCamp

Odhad počtu obyvatel Francie

Mapa Francie.

Sčítání lidu zjišťuje počet osob v každé domácnosti.

Vzorkování v R

Ve Francii žije mnoho lidí

Mapa Francie s ikonami lidí.

Sčítání lidu je velmi nákladné!

Vzorkování v R

Vzorkování domácností

Mapa Francie s ikonami lidí, některé jsou zvýrazněny.

Je levnější dotazovat se malého počtu domácností a pomocí statistiky odhadovat celou populaci.

Práce s podmnožinou celé populace se nazývá vzorkování.

Vzorkování v R

Populace vs. vzorek

Populace je kompletní datová sada.

  • Nemusí se jednat o lidi.
  • Celou populaci obvykle neznáme.

Vzorek je podmnožina dat, se kterou pracujeme.

Vzorkování v R

Dataset hodnocení kávy

total_cup_points variety country_of_origin aroma flavor aftertaste body balance
90.58 NA Ethiopia 8.67 8.83 8.67 8.50 8.42
89.92 Other Ethiopia 8.75 8.67 8.50 8.42 8.42
... ... ... ... ... ... ... ...
73.75 NA Vietnam 6.75 6.67 6.5 6.92 6.83
  • Každý řádek představuje 1 kávu.
  • 1138 řádků.
  • Budeme to považovat za populaci.
Vzorkování v R

Body vs. chuť: populace

pts_vs_flavor_pop <- coffee_ratings %>% 
  select(total_cup_points, flavor)
dim(pts_vs_flavor_pop)
1338    2
     total_cup_points flavor
1               90.58   8.83
2               89.92   8.67
3               89.75   8.50
4               89.00   8.58
...              ...     ...
1335            78.08   7.67
1336            77.17   7.33
1337            75.08   6.83
1338            73.75   6.67
Vzorkování v R

Body vs. chuť: vzorek 10 řádků

pts_vs_flavor_samp <- coffee_ratings %>% 
  select(total_cup_points, flavor) %>%
  slice_sample(n = 10)
dim(pts_vs_flavor_samp)
10  2
   total_cup_points flavor
1             82.25   7.58
2             83.50   7.67
3             80.50   7.17
4             79.33   7.17
5             83.83   7.58
6             84.17   7.75
7             83.67   8.17
8             81.92   7.50
9             82.67   7.58
10            83.42   7.67
Vzorkování v R

Vzorkování v základním R

Pro datové rámce použijte slice_sample(), pro vektory sample().

cup_points_samp <- sample(coffee_ratings$total_cup_points, size = 10)
88.25 83.83 83.17 82.67 84.67 83.42 73.67 86.00 81.58 80.92
Vzorkování v R

Parametry populace a bodové odhady

Parametr populace je výpočet provedený na celé datové sadě populace.

mean(pts_vs_flavor_pop$total_cup_points)
82.15

Bodový odhad neboli výběrová statistika je výpočet provedený na vzorku.

mean(cup_points_samp)
82.82
Vzorkování v R

Bodové odhady pomocí dplyr

pts_vs_flavor_pop %>% 
  summarize(mean_flavor = mean(flavor)) 
  mean_flavor
1       7.526
pts_vs_flavor_samp %>% 
  summarize(mean_flavor = mean(flavor)) 
  mean_flavor
1       7.716
Vzorkování v R

Pojďme si procvičit!

Vzorkování v R

Preparing Video For Download...