Бутстрепінг

Основи інференції в R

Jo Hardin

Instructor

Перевірка гіпотез

  • Як варіюють вибірки з нульової сукупності?

  • Статистика, частка успіхів у вибірці → $\hat{p}$

  • Параметр, частка успіхів у генеральній сукупності → ${p}$

Основи інференції в R

Довірчі інтервали

  • Немає нульової сукупності, на відміну від перевірки гіпотез
  • Як варіюють $p$ і $\hat{p}$?
Основи інференції в R

ch4_2_v4.012.png

Основи інференції в R

ch4_2_v4.013.png

Основи інференції в R

ch4_2_v4.014.png

Основи інференції в R

ch4_2_v4.015.png

Основи інференції в R

ch4_2_v4.016.png

Основи інференції в R

ch4_2_v4.017.png

Основи інференції в R

ch4_2_v4.018.png

Основи інференції в R

ch4_2_v4.019.png

Основи інференції в R

ch4_2_v4.020.png

Основи інференції в R

Опитування

# Original data
Source: local data frame [30 x 3]
     flip_num  flip
        <int>  <chr>
1          1       H
2          2       H
3          3       H
4          4       T
5          5       H                
6          6       H
# ... with 24 more rows

Початкові дані

Кандидат X Виборців разом Частка X
17 30 0.5667
Основи інференції в R

Опитування

# First resample
Source: local data frame [30 x 3]
   replicate flip_num  flip
       <dbl>    <int> <chr>
1          1        7     H
2          1       17     T
3          1       13     H
4          1       14     H
5          1       24     H
6          1       28     T
# ... with 24 more rows

Перше повторне вибіркування

Кандидат X Виборців разом Частка X
17 30 0.5667
14 30 0.4667
Основи інференції в R

Опитування

# Second resample
Source: local data frame [30 x 3]
   replicate flip_num  flip
       <dbl>    <int> <chr>
1          2       21     H
2          2       19     T
3          2       25     H
4          2       24     T
5          2       21     H
6          2       28     T
7          2       13     H
8          2       23     H
9          2       24     T
10         2       24     T
# ... with 20 more rows 

Друге повторне вибіркування

Кандидат X Виборців разом Частка X
17 30 0.5667
14 30 0.4667
18 30 0.6
Основи інференції в R

Опитування

# Third resample
Source: local data frame [30 x 3]
   replicate flip_num  flip
       <dbl>    <int> <chr>
1          3        6     H
2          3       19     H
3          3        1     H
4          3       24     T
5          3       11     H
6          3       28     T
7          3       16     H
8          3       13     H
9          3       21     T
10         3       29     H
# ... with 20 more rows

Третє повторне вибіркування

Кандидат X Виборців разом Частка X
17 30 0.5667
14 30 0.4667
18 30 0.6
12 30 0.4
Основи інференції в R

Стандартна помилка

  • Отримали стандартну помилку 0,09 після багатьох повторних вибіркувань

  • Показує, як статистика коливається навколо параметра

  • Бутстреп наближує стандартну помилку

Основи інференції в R

Мінливість p-hat із сукупності

# Обчислити p-hat для кожного опитування
ex1_props <- recommend %>% 
    group_by(poll) %>% 
    summarize(prop_yes = 
                mean(vote == "yes"))
# Мінливість p-hat
ex1_props %>% 
    summarize(sd(prop_yes))
# A tibble: 1 × 1
  `sd(prop_yes)`
           <dbl>
1     0.08523512
Основи інференції в R

Мінливість p-hat з вибірки (бутстрепінг)

# Обрати одне опитування для повторного вибіркування
one_poll <- all_polls %>%
    filter(poll ==1) %>%
    select(vote)

# Обчислити p-hat для кожного повторно вибіркованого опитування
ex2_props <- one_poll %>%
    specify(response = vote,
            success = "yes") %>%
    generate(reps = 1000,
            type = "bootstrap")
# Мінливість p-hat
ex2_props %>% 
    summarize(sd(stat))
# A tibble: 1 × 1
  `sd(stat)`
           <dbl>
1     0.08691885
Основи інференції в R

Давайте потренуємось!

Основи інференції в R

Preparing Video For Download...