Convenience sampling

Vzorkování v R

Richie Cotton

Data Evangelist at DataCamp

Předpověď voleb v Literary Digest

Titulní strana časopisu Literary Digest z roku 1936 s titulkem předpovědí voleb. Landon měl získat 1,3 milionu hlasů, Roosevelt necelý 1 milion.

  • Předpověď: Landon 57 %; Roosevelt 43 %
  • Skutečnost: Landon 38 %; Roosevelt 62 %
  • Vzorek nebyl reprezentativní pro populaci – výběrová chyba.
  • Sběr dat nejjednodušší cestou se nazývá convenience sampling.
Vzorkování v R

Zjišťování průměrného věku Francouzů

Fotografie Disneylandu Paříž.

  • Průzkum 10 osob v Disneylandu Paříž.
  • Průměrný věk je 24,6 let.
  • Je to dobrý odhad pro celou Francii?
1 Foto: Sean MacEntee
Vzorkování v R

Jak přesný byl průzkum?

Rok Průměrný věk Francouzů
1975 31,6
1985 33,6
1995 36,2
2005 38,9
2015 41,2
  • 24,6 let je nepřesný odhad.
  • Návštěvníci Disneylandu nejsou reprezentativní pro celou populaci.
Vzorkování v R

Convenience sampling hodnocení kávy

coffee_ratings %>% 
  summarize(mean_cup_points = mean(total_cup_points))
  mean_cup_points
1           82.09
coffee_ratings_first10 <- coffee_ratings %>% 
  slice_head(n = 10)
coffee_ratings_first10 %>% 
  summarize(mean_cup_points = mean(total_cup_points))
  mean_cup_points
1            89.1
Vzorkování v R

Vizualizace výběrové chyby

coffee_ratings %>%
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2)

Histogram bodů šálku z populace.

coffee_ratings_first10 %>%
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2) +
  xlim(59, 91)

Histogram bodů šálku ze vzorku.

Vzorkování v R

Vizualizace výběrové chyby 2

coffee_ratings %>%
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2) 

Histogram bodů šálku z populace.

coffee_ratings %>%
  slice_sample(n = 10) %>% 
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2) +
  xlim(59, 91)

Histogram bodů šálku z náhodného vzorku.

Vzorkování v R

Pojďme si procvičit!

Vzorkování v R

Preparing Video For Download...