Przedziały ufności

Próbkowanie w R

Richie Cotton

Data Evangelist at DataCamp

Przedziały ufności

  • „Wartości w odległości jednego odchylenia standardowego od średniej" obejmują dużą liczbę wartości z każdego z tych rozkładów.
  • Zdefiniujemy powiązane pojęcie zwane przedziałem ufności.
Próbkowanie w R

Prognozowanie pogody

  • Rapid City w Południowej Dakocie (USA) ma najmniej przewidywalną pogodę.
  • Należy przewidzieć jutrzejszą maksymalną temperaturę w tym miejscu.

Mapa pogody z kolorami wskazującymi przewidywalność regionów.

Próbkowanie w R

Prognoza pogody

  • Estymator punktowy = 47 °F (8,3 °C)
  • Zakres wiarygodnych wartości maksymalnej temperatury = 40–54 °F (4,4–12,8 °C)
Próbkowanie w R

Właśnie podano przedział ufności

  • 40–54 °F to przedział ufności
  • Zapisywany też jako 47 °F (40 °F, 54 °F) lub 47 °F [40 °F, 54 °F]
  • ... lub 47 ± 7 °F
  • 7 °F to margines błędu
Próbkowanie w R

Rozkład bootstrap średniej smaku

ggplot(coffee_boot_distn, aes(resample_mean)) +
  geom_histogram(binwidth = 0.002)

Histogram średnich wartości smaku kawy.

Próbkowanie w R

Średnia z prób bootstrap

coffee_boot_distn %>% 
  summarize(
    mean_resample_mean = mean(resample_mean)
  )
# A tibble: 1 x 1
  mean_resample_mean
               <dbl>
1             7.5263

Histogram średnich wartości smaku kawy z zaznaczoną średnią pionowym niebieskim paskiem.

Próbkowanie w R

Średnia plus/minus jedno odchylenie standardowe

coffee_boot_distn %>% 
  summarize(
    mean_resample_mean = mean(resample_mean),
    mean_minus_1sd = mean_resample_mean - sd(resample_mean),
    mean_plus_1sd = mean_resample_mean + sd(resample_mean)
  )
# A tibble: 1 x 3
  mean_resample_mean mean_plus_1sd mean_minus_1sd
               <dbl>         <dbl>          <dbl>
1             7.5263        7.5355         7.5171

Histogram średnich smaku kawy z zaznaczonymi średnią i odchyleniami standardowymi pionowymi paskami.

Próbkowanie w R

Metoda kwantylowa dla przedziałów ufności

coffee_boot_distn %>% 
  summarize(
    lower = quantile(resample_mean, 0.025),
    upper = quantile(resample_mean, 0.975)
  )
# A tibble: 1 x 2
   lower  upper
   <dbl>  <dbl>
1 7.5087 7.5447

Linia 95-procentowego przedziału ufności.

Próbkowanie w R

Odwrotna dystrybuanta

  • PDF: krzywa dzwonowa
  • CDF: całkowanie daje pole pod krzywą
  • Odwrotna CDF: zamiana osi x i y
normal_inv_cdf <- tibble(
  p = seq(-0.001, 0.999, 0.001),
  inv_cdf = qnorm(p)
)
ggplot(normal_inv_cdf, aes(p, inv_cdf)) +
  geom_line()

Odwrotna dystrybuanta rozkładu normalnego.

1 Patrz „Introduction to Statistics in R", rozdz. 3, „The Normal Distribution"
Próbkowanie w R

Metoda błędu standardowego dla przedziału ufności

coffee_boot_distn %>% 
  summarize(
    point_estimate = mean(resample_mean),
    std_error = sd(resample_mean),

lower = qnorm(0.025, point_estimate, std_error), upper = qnorm(0.975, point_estimate, std_error)
)
# A tibble: 1 x 4
  point_estimate std_error  lower  upper
           <dbl>     <dbl>  <dbl>  <dbl>
1         7.5263 0.0091815 7.5083 7.5443
Próbkowanie w R

Czas na ćwiczenia!

Próbkowanie w R

Preparing Video For Download...