Lấy mẫu trong R
Richie Cotton
Data Evangelist at DataCamp
set.seed(19790801)
coffee_sample <- coffee_ratings %>%
select(variety, country_of_origin, flavor) %>%
rowid_to_column() %>%
slice_sample(n = 500)
glimpse(coffee_sample)
Rows: 500
Columns: 4
$ rowid <int> 10, 278, 458, 622, 131, 385, 1292, 47, 904, 1020, 5...
$ variety <chr> "Other", "Bourbon", NA, "Caturra", "Caturra", "Yell...
$ country_of_origin <chr> "Ethiopia", "Guatemala", "Colombia", "Thailand", "C...
$ flavor <dbl> 8.58, 7.75, 7.75, 7.50, 8.00, 7.83, 7.17, 8.08, 7.3...
mean_flavors_1000 <- replicate(
n = 1000,
expr = coffee_sample %>%
slice_sample(prop = 1, replace = TRUE) %>%
summarize(mean_flavor = mean(flavor, na.rm = TRUE)) %>%
pull(mean_flavor)
)
bootstrap_distn <- tibble(
resample_mean = mean_flavors_1000
)
ggplot(bootstrap_distn, aes(resample_mean)) +
geom_histogram(binwidth = 0.0025)

Trung bình mẫu
coffee_sample %>%
summarize(mean_flavor = mean(flavor)) %>%
pull(mean_flavor)
7.5163
Ước lượng trung bình quần thể
bootstrap_distn %>%
summarize(mean_mean_flavor = mean(resample_mean)) %>%
pull(mean_mean_flavor)
7.5167
Trung bình quần thể thực
coffee_ratings %>%
summarize(mean_flavor = mean(flavor)) %>%
pull(mean_flavor)
7.5260
Độ lệch chuẩn mẫu
coffee_focus %>%
summarize(sd_flavor = sd(flavor)) %>%
pull(sd_flavor)
0.3525
Ước lượng độ lệch chuẩn quần thể?
bootstrap_distn %>%
summarize(sd_mean_flavor = sd(resample_mean)) %>%
pull(sd_mean_flavor)
0.01572
Độ lệch chuẩn mẫu
coffee_focus %>%
summarize(sd_flavor = sd(flavor)) %>%
pull(sd_flavor)
0.3525
Ước lượng độ lệch chuẩn quần thể
standard_error <- bootstrap_distn %>%
summarize(sd_mean_flavor = sd(resample_mean)) %>%
pull(sd_mean_flavor)
standard_error * sqrt(500)
0.3515
Độ lệch chuẩn thực
coffee_ratings %>%
summarize(sd_flavor = sd(flavor)) %>%
pull(sd_flavor)
0.3414
Sai số chuẩn là độ lệch chuẩn của thống kê quan tâm.
Sai số chuẩn nhân căn bậc hai cỡ mẫu ước lượng độ lệch chuẩn quần thể.
Lấy mẫu trong R