So sánh phân phối lấy mẫu và bootstrap

Lấy mẫu trong R

Richie Cotton

Data Evangelist at DataCamp

Tập con tập trung vào cà phê

set.seed(19790801)
coffee_sample <- coffee_ratings %>%
  select(variety, country_of_origin, flavor) %>%
  rowid_to_column() %>% 
  slice_sample(n = 500)
glimpse(coffee_sample)
Rows: 500
Columns: 4
$ rowid             <int> 10, 278, 458, 622, 131, 385, 1292, 47, 904, 1020, 5...
$ variety           <chr> "Other", "Bourbon", NA, "Caturra", "Caturra", "Yell...
$ country_of_origin <chr> "Ethiopia", "Guatemala", "Colombia", "Thailand", "C...
$ flavor            <dbl> 8.58, 7.75, 7.75, 7.50, 8.00, 7.83, 7.17, 8.08, 7.3...
Lấy mẫu trong R

Bootstrap của trung bình hương vị cà phê

mean_flavors_1000 <- replicate(
  n = 1000,
  expr = coffee_sample %>%
    slice_sample(prop = 1, replace = TRUE) %>%
    summarize(mean_flavor = mean(flavor, na.rm = TRUE)) %>%
    pull(mean_flavor)
)
bootstrap_distn <- tibble(
  resample_mean = mean_flavors_1000
)
Lấy mẫu trong R

Phân phối bootstrap của trung bình hương vị

 ggplot(bootstrap_distn, aes(resample_mean)) +
  geom_histogram(binwidth = 0.0025)

Biểu đồ histogram của phân phối bootstrap.

Lấy mẫu trong R

Trung bình: mẫu, phân phối bootstrap, quần thể

Trung bình mẫu

coffee_sample %>% 
  summarize(mean_flavor = mean(flavor)) %>% 
  pull(mean_flavor)
7.5163

Ước lượng trung bình quần thể

bootstrap_distn %>% 
  summarize(mean_mean_flavor = mean(resample_mean)) %>% 
  pull(mean_mean_flavor)
7.5167

Trung bình quần thể thực

coffee_ratings %>% 
  summarize(mean_flavor = mean(flavor)) %>% 
  pull(mean_flavor)
7.5260
Lấy mẫu trong R

Diễn giải các giá trị trung bình

  • Trung bình của phân phối bootstrap thường gần trùng với trung bình mẫu.
  • Có thể không ước lượng tốt trung bình quần thể.
  • Bootstrap không sửa được sai lệch do khác biệt giữa mẫu và quần thể.
Lấy mẫu trong R

Độ lệch chuẩn mẫu vs độ lệch chuẩn phân phối bootstrap

Độ lệch chuẩn mẫu

coffee_focus %>% 
  summarize(sd_flavor = sd(flavor)) %>% 
  pull(sd_flavor)
0.3525

Ước lượng độ lệch chuẩn quần thể?

bootstrap_distn %>% 
  summarize(sd_mean_flavor = sd(resample_mean)) %>% 
  pull(sd_mean_flavor)
0.01572
Lấy mẫu trong R

Độ lệch chuẩn: mẫu, phân phối bootstrap, quần thể

Độ lệch chuẩn mẫu

coffee_focus %>% 
  summarize(sd_flavor = sd(flavor)) %>% 
  pull(sd_flavor)
0.3525

Ước lượng độ lệch chuẩn quần thể

standard_error <- bootstrap_distn %>%
  summarize(sd_mean_flavor = sd(resample_mean)) %>% 
  pull(sd_mean_flavor)
standard_error * sqrt(500)
0.3515

Độ lệch chuẩn thực

coffee_ratings %>%
  summarize(sd_flavor = sd(flavor)) %>%
  pull(sd_flavor)
0.3414

Sai số chuẩn là độ lệch chuẩn của thống kê quan tâm.

Sai số chuẩn nhân căn bậc hai cỡ mẫu ước lượng độ lệch chuẩn quần thể.

Lấy mẫu trong R

Diễn giải sai số chuẩn

  • Sai số chuẩn ước lượng là độ lệch chuẩn của phân phối bootstrap cho một thống kê mẫu.
  • Sai số chuẩn của phân phối bootstrap nhân căn bậc hai cỡ mẫu ước lượng độ lệch chuẩn quần thể.
Lấy mẫu trong R

Hãy luyện tập!

Lấy mẫu trong R

Preparing Video For Download...