Próbkowanie wygodne

Próbkowanie w R

Richie Cotton

Data Evangelist at DataCamp

Prognoza wyborcza Literary Digest

Okładka Literary Digest z 1936 roku z nagłówkiem o prognozach wyborczych. Landon miał uzyskać 1,3 mln głosów, Roosevelt niespełna 1 mln.

  • Prognoza: Landon 57%; Roosevelt 43%
  • Wynik rzeczywisty: Landon 38%; Roosevelt 62%
  • Próba nie reprezentowała populacji — błąd próby.
  • Zbieranie danych najprostszą metodą to próbkowanie wygodne.
Próbkowanie w R

Szacowanie średniego wieku Francuzów

Zdjęcie Disneylandu w Paryżu.

  • Ankieta wśród 10 osób w Disneyland Paris.
  • Średni wiek: 24,6 lat.
  • Czy to dobry szacunek dla całej Francji?
1 Zdjęcie: Sean MacEntee
Próbkowanie w R

Jak trafna była ankieta?

Rok Średni wiek we Francji
1975 31,6
1985 33,6
1995 36,2
2005 38,9
2015 41,2
  • 24,6 lat to słaby szacunek.
  • Odwiedzający Disneyland nie reprezentują całej populacji.
Próbkowanie w R

Próbkowanie wygodne ocen kawy

coffee_ratings %>% 
  summarize(mean_cup_points = mean(total_cup_points))
  mean_cup_points
1           82.09
coffee_ratings_first10 <- coffee_ratings %>% 
  slice_head(n = 10)
coffee_ratings_first10 %>% 
  summarize(mean_cup_points = mean(total_cup_points))
  mean_cup_points
1            89.1
Próbkowanie w R

Wizualizacja błędu selekcji

coffee_ratings %>%
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2)

Histogram punktów kubkowych z populacji.

coffee_ratings_first10 %>%
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2) +
  xlim(59, 91)

Histogram punktów kubkowych z próby.

Próbkowanie w R

Wizualizacja błędu selekcji 2

coffee_ratings %>%
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2) 

Histogram punktów kubkowych z populacji.

coffee_ratings %>%
  slice_sample(n = 10) %>% 
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2) +
  xlim(59, 91)

Histogram punktów kubkowych z próby losowej.

Próbkowanie w R

Czas na ćwiczenia!

Próbkowanie w R

Preparing Video For Download...