Lấy mẫu thuận tiện

Lấy mẫu trong R

Richie Cotton

Data Evangelist at DataCamp

Dự đoán bầu cử của Literary Digest

Trang nhất tạp chí Literary Digest năm 1936 với tiêu đề dự đoán bầu cử. Dự báo: Landon sẽ được 1,3 triệu phiếu; Roosevelt gần 1 triệu phiếu.

  • Dự đoán: Landon 57%; Roosevelt 43%
  • Thực tế: Landon 38%; Roosevelt 62%
  • Mẫu không đại diện cho quần thể, gây ra sai lệch mẫu.
  • Thu thập dữ liệu theo cách dễ nhất gọi là lấy mẫu thuận tiện.
Lấy mẫu trong R

Tìm tuổi trung bình của người Pháp

Ảnh Disneyland Paris.

  • Khảo sát 10 người tại Disneyland Paris.
  • Tuổi trung bình của họ là 24,6.
  • Con số này có ước tính tốt cho toàn nước Pháp không?
1 Ảnh của Sean MacEntee
Lấy mẫu trong R

Khảo sát chính xác đến đâu?

Năm Tuổi trung bình người Pháp
1975 31.6
1985 33.6
1995 36.2
2005 38.9
2015 41.2
  • 24,6 là ước tính kém.
  • Khách Disneyland không đại diện cho toàn bộ dân số.
Lấy mẫu trong R

Lấy mẫu thuận tiện: điểm cà phê

coffee_ratings %>% 
  summarize(mean_cup_points = mean(total_cup_points))
  mean_cup_points
1           82.09
coffee_ratings_first10 <- coffee_ratings %>% 
  slice_head(n = 10)
coffee_ratings_first10 %>% 
  summarize(mean_cup_points = mean(total_cup_points))
  mean_cup_points
1            89.1
Lấy mẫu trong R

Trực quan hóa sai lệch chọn mẫu

coffee_ratings %>%
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2)

Biểu đồ tần suất điểm cốc của toàn bộ quần thể.

coffee_ratings_first10 %>%
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2) +
  xlim(59, 91)

Biểu đồ tần suất điểm cốc của mẫu.

Lấy mẫu trong R

Trực quan hóa sai lệch chọn mẫu 2

coffee_ratings %>%
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2) 

Biểu đồ tần suất điểm cốc của toàn bộ quần thể.

coffee_ratings %>%
  slice_sample(n = 10) %>% 
  ggplot(aes(x = total_cup_points)) +
  geom_histogram(binwidth = 2) +
  xlim(59, 91)

Biểu đồ tần suất điểm cốc của một mẫu ngẫu nhiên.

Lấy mẫu trong R

Ayo berlatih!

Lấy mẫu trong R

Preparing Video For Download...