Intervalles de confiance

Échantillonnage en R

Richie Cotton

Data Evangelist at DataCamp

Intervalles de confiance

  • « Les valeurs à une écart-type de la moyenne » couvrent une grande part de chaque distribution.
  • Nous allons définir un concept connexe : un intervalle de confiance.
Échantillonnage en R

Prévoir la météo

  • Rapid City, au Dakota du Sud, aux États-Unis, a la météo la moins prévisible.
  • Votre tâche : prévoir la température maximale demain.

Carte météo avec des couleurs indiquant le degré de prévisibilité par région.

Échantillonnage en R

Votre prévision météo

  • estimation ponctuelle = 47 °F (8,3 °C)
  • plage de valeurs plausibles pour la maximale = 40 à 54 °F (4,4 à 12,8 °C)
Échantillonnage en R

Vous venez de donner un intervalle de confiance

  • 40 à 54 °F est un intervalle de confiance
  • Parfois noté 47 °F (40 °F, 54 °F) ou 47 °F [40 °F, 54 °F]
  • … ou 47 ± 7 °F
  • 7 °F est la marge d'erreur
Échantillonnage en R

Distribution bootstrap de la saveur moyenne

ggplot(coffee_boot_distn, aes(resample_mean)) +
  geom_histogram(binwidth = 0.002)

Histogramme de la saveur moyenne du café.

Échantillonnage en R

Moyenne des rééchantillonnages

coffee_boot_distn %>% 
  summarize(
    mean_resample_mean = mean(resample_mean)
  )
# A tibble: 1 x 1
  mean_resample_mean
               <dbl>
1             7.5263

Histogramme de la saveur moyenne du café avec la moyenne indiquée par une barre bleue verticale.

Échantillonnage en R

Moyenne plus ou moins un écart-type

coffee_boot_distn %>% 
  summarize(
    mean_resample_mean = mean(resample_mean),
    mean_minus_1sd = mean_resample_mean - sd(resample_mean),
    mean_plus_1sd = mean_resample_mean + sd(resample_mean)
  )
# A tibble: 1 x 3
  mean_resample_mean mean_plus_1sd mean_minus_1sd
               <dbl>         <dbl>          <dbl>
1             7.5263        7.5355         7.5171

Histogramme des moyennes de saveur du café avec la moyenne et les écarts-types indiqués par des barres verticales.

Échantillonnage en R

Méthode des quantiles pour les intervalles de confiance

coffee_boot_distn %>% 
  summarize(
    lower = quantile(resample_mean, 0.025),
    upper = quantile(resample_mean, 0.975)
  )
# A tibble: 1 x 2
   lower  upper
   <dbl>  <dbl>
1 7.5087 7.5447

Intervalle de confiance de 95 %.

Échantillonnage en R

Fonction de répartition cumulative inverse

  • PDF : la cloche (densité)
  • CDF : intégrer pour l'aire sous la courbe en cloche
  • Fct CDF inverse : inverser les axes x et y
normal_inv_cdf <- tibble(
  p = seq(-0.001, 0.999, 0.001),
  inv_cdf = qnorm(p)
)
ggplot(normal_inv_cdf, aes(p, inv_cdf)) +
  geom_line()

Fonction de répartition cumulative inverse.

1 Voir « Introduction to Statistics in R », ch. 3, « The Normal Distribution »
Échantillonnage en R

Méthode de l'erreur-type pour l'intervalle de confiance

coffee_boot_distn %>% 
  summarize(
    point_estimate = mean(resample_mean),
    std_error = sd(resample_mean),

lower = qnorm(0.025, point_estimate, std_error), upper = qnorm(0.975, point_estimate, std_error)
)
# A tibble: 1 x 4
  point_estimate std_error  lower  upper
           <dbl>     <dbl>  <dbl>  <dbl>
1         7.5263 0.0091815 7.5083 7.5443
Échantillonnage en R

Passons à la pratique !

Échantillonnage en R

Preparing Video For Download...