比較抽樣與自助法分佈

R 的抽樣

Richie Cotton

Data Evangelist at DataCamp

聚焦咖啡子集

set.seed(19790801)
coffee_sample <- coffee_ratings %>%
  select(variety, country_of_origin, flavor) %>%
  rowid_to_column() %>% 
  slice_sample(n = 500)
glimpse(coffee_sample)
Rows: 500
Columns: 4
$ rowid             <int> 10, 278, 458, 622, 131, 385, 1292, 47, 904, 1020, 5...
$ variety           <chr> "Other", "Bourbon", NA, "Caturra", "Caturra", "Yell...
$ country_of_origin <chr> "Ethiopia", "Guatemala", "Colombia", "Thailand", "C...
$ flavor            <dbl> 8.58, 7.75, 7.75, 7.50, 8.00, 7.83, 7.17, 8.08, 7.3...
R 的抽樣

咖啡風味平均值的自助法

mean_flavors_1000 <- replicate(
  n = 1000,
  expr = coffee_sample %>%
    slice_sample(prop = 1, replace = TRUE) %>%
    summarize(mean_flavor = mean(flavor, na.rm = TRUE)) %>%
    pull(mean_flavor)
)
bootstrap_distn <- tibble(
  resample_mean = mean_flavors_1000
)
R 的抽樣

風味平均值的自助法分佈

 ggplot(bootstrap_distn, aes(resample_mean)) +
  geom_histogram(binwidth = 0.0025)

自助法分佈的長條圖。

R 的抽樣

樣本、自助法分佈、母體的平均

樣本平均

coffee_sample %>% 
  summarize(mean_flavor = mean(flavor)) %>% 
  pull(mean_flavor)
7.5163

母體平均的估計值

bootstrap_distn %>% 
  summarize(mean_mean_flavor = mean(resample_mean)) %>% 
  pull(mean_mean_flavor)
7.5167

真實母體平均

coffee_ratings %>% 
  summarize(mean_flavor = mean(flavor)) %>% 
  pull(mean_flavor)
7.5260
R 的抽樣

解讀平均值

  • 自助法分佈的平均通常與樣本平均幾乎相同。
  • 但不一定是母體平均的良好估計。
  • 自助法無法修正樣本與母體差異所造成的偏差。
R 的抽樣

樣本 sd 與自助法分佈 sd

樣本標準差

coffee_focus %>% 
  summarize(sd_flavor = sd(flavor)) %>% 
  pull(sd_flavor)
0.3525

母體標準差的估計?

bootstrap_distn %>% 
  summarize(sd_mean_flavor = sd(resample_mean)) %>% 
  pull(sd_mean_flavor)
0.01572
R 的抽樣

樣本、自助法分佈、母體的標準差

樣本標準差

coffee_focus %>% 
  summarize(sd_flavor = sd(flavor)) %>% 
  pull(sd_flavor)
0.3525

母體標準差的估計

standard_error <- bootstrap_distn %>%
  summarize(sd_mean_flavor = sd(resample_mean)) %>% 
  pull(sd_mean_flavor)
standard_error * sqrt(500)
0.3515

真實標準差

coffee_ratings %>%
  summarize(sd_flavor = sd(flavor)) %>%
  pull(sd_flavor)
0.3414

Standard error 是目標統計量的標準差。

Standard error 乘上樣本大小的平方根可用來估計母體標準差。

R 的抽樣

解讀標準誤

  • 「標準誤」的估計值,是樣本統計量之自助法分佈的標準差。
  • 將「自助法分佈的標準誤」乘上樣本大小的平方根,可估計母體的標準差。
R 的抽樣

一起來練習吧!

R 的抽樣

Preparing Video For Download...