Intervaly spolehlivosti

Vzorkování v R

Richie Cotton

Data Evangelist at DataCamp

Intervaly spolehlivosti

  • „Hodnoty do jedné směrodatné odchylky od průměru“ zahrnují velké množství hodnot z každého z těchto rozdělení.
  • Zavedeme související pojem nazvaný interval spolehlivosti.
Vzorkování v R

Předpověď počasí

  • Rapid City v Jižní Dakotě ve Spojených státech má nejméně předvídatelné počasí.
  • Vaším úkolem je předpovědět zítřejší nejvyšší teplotu tam.

Mapa počasí s barevným vyznačením předvídatelnosti jednotlivých oblastí.

Vzorkování v R

Vaše předpověď počasí

  • bodový odhad = 47 °F (8,3 °C)
  • rozsah pravděpodobných hodnot nejvyšší teploty = 40 až 54 °F (4,4 až 12,8 °C)
Vzorkování v R

Právě jste uvedli interval spolehlivosti

  • 40 až 54 °F je interval spolehlivosti
  • Někdy zapsán jako 47 °F (40 °F, 54 °F) nebo 47 °F [40 °F, 54 °F]
  • ... nebo 47 ± 7 °F
  • 7 °F je meze chyby
Vzorkování v R

Bootstrapové rozdělení průměrné chuti

ggplot(coffee_boot_distn, aes(resample_mean)) +
  geom_histogram(binwidth = 0.002)

Histogram průměrné chuti kávy.

Vzorkování v R

Průměr resamplingů

coffee_boot_distn %>% 
  summarize(
    mean_resample_mean = mean(resample_mean)
  )
# A tibble: 1 x 1
  mean_resample_mean
               <dbl>
1             7.5263

Histogram průměrné chuti kávy s průměrem vyznačeným svislou modrou čarou.

Vzorkování v R

Průměr plus/minus jedna směrodatná odchylka

coffee_boot_distn %>% 
  summarize(
    mean_resample_mean = mean(resample_mean),
    mean_minus_1sd = mean_resample_mean - sd(resample_mean),
    mean_plus_1sd = mean_resample_mean + sd(resample_mean)
  )
# A tibble: 1 x 3
  mean_resample_mean mean_plus_1sd mean_minus_1sd
               <dbl>         <dbl>          <dbl>
1             7.5263        7.5355         7.5171

Histogram průměrů chuti kávy s průměrem a směrodatnými odchylkami vyznačenými svislými čarami.

Vzorkování v R

Metoda kvantilů pro intervaly spolehlivosti

coffee_boot_distn %>% 
  summarize(
    lower = quantile(resample_mean, 0.025),
    upper = quantile(resample_mean, 0.975)
  )
# A tibble: 1 x 2
   lower  upper
   <dbl>  <dbl>
1 7.5087 7.5447

Linie 95% intervalu spolehlivosti.

Vzorkování v R

Inverzní kumulativní distribuční funkce

  • PDF: křivka normálního rozdělení
  • CDF: integrací získáme plochu pod křivkou
  • Inv. CDF: přehození os x a y
normal_inv_cdf <- tibble(
  p = seq(-0.001, 0.999, 0.001),
  inv_cdf = qnorm(p)
)
ggplot(normal_inv_cdf, aes(p, inv_cdf)) +
  geom_line()

Inverzní kumulativní distribuční funkce.

1 Viz „Introduction to Statistics in R“, kap. 3, „The Normal Distribution“
Vzorkování v R

Metoda standardní chyby pro interval spolehlivosti

coffee_boot_distn %>% 
  summarize(
    point_estimate = mean(resample_mean),
    std_error = sd(resample_mean),

lower = qnorm(0.025, point_estimate, std_error), upper = qnorm(0.975, point_estimate, std_error)
)
# A tibble: 1 x 4
  point_estimate std_error  lower  upper
           <dbl>     <dbl>  <dbl>  <dbl>
1         7.5263 0.0091815 7.5083 7.5443
Vzorkování v R

Pojďme procvičovat!

Vzorkování v R

Preparing Video For Download...