Intervalles de confiance

Échantillonnage en Python

James Chapman

Curriculum Manager, DataCamp

Intervalles de confiance

  • « Valeurs à une écart-type de la moyenne » couvre une large part de chaque distribution
  • Nous allons définir une notion liée, l'intervalle de confiance
Échantillonnage en Python

Prévoir la météo

  • Rapid City, au Dakota du Sud (États-Unis), a la météo la moins prévisible
  • Notre tâche : prévoir la température maximale de demain

Carte météorologique, les couleurs indiquent la prévisibilité des régions.

Échantillonnage en Python

Notre prévision météo

  • Estimation ponctuelle = 47 °F (8,3 °C)
  • Plage plausible des maximales = 40 à 54 °F (4,4 à 12,8 °C)
Échantillonnage en Python

Nous venons de rapporter un intervalle de confiance !

  • 40 à 54 °F est un intervalle de confiance
  • Parfois écrit : 47 °F (40 °F, 54 °F) ou 47 °F [40 °F, 54 °F]
  • … ou 47 ± 7 °F
  • 7 °F est la marge d'erreur
Échantillonnage en Python

Distribution bootstrap de la saveur moyenne

import matplotlib.pyplot as plt
plt.hist(coffee_boot_distn, bins=15)
plt.show()

Histogramme de la saveur moyenne du café.

Échantillonnage en Python

Moyenne des rééchantillonnages

import numpy as np
np.mean(coffee_boot_distn)
7.513452892

Histogramme de la saveur moyenne du café, avec la moyenne indiquée par une barre verticale noire.

Échantillonnage en Python

Moyenne plus ou moins un écart-type

np.mean(coffee_boot_distn)
7.513452892
np.mean(coffee_boot_distn) - np.std(coffee_boot_distn, ddof=1)
7.497385709174466
np.mean(coffee_boot_distn) + np.std(coffee_boot_distn, ddof=1)
7.529520074825534

Histogramme des moyennes de saveur du café avec la moyenne et les écarts-types indiqués par des barres verticales.

Échantillonnage en Python

Méthode des quantiles pour les intervalles de confiance

np.quantile(coffee_boot_distn, 0.025)
7.4817195
np.quantile(coffee_boot_distn, 0.975)
7.5448805

Intervalle de confiance à 95 %.

Échantillonnage en Python

Fonction de répartition cumulative inverse

  • PDF : la courbe en cloche
  • CDF : intégrer pour obtenir l'aire sous la cloche
  • CDF inv. : échanger les axes x et y

Implémenté en Python avec

from scipy.stats import norm
norm.ppf(quantile, loc=0, scale=1)

Fonction de répartition inverse.

Échantillonnage en Python

Méthode de l'erreur-type pour l'intervalle de confiance

point_estimate = np.mean(coffee_boot_distn)
7.513452892
std_error = np.std(coffee_boot_distn, ddof=1)
0.016067182825533724
from scipy.stats import norm
lower = norm.ppf(0.025, loc=point_estimate, scale=std_error)
upper = norm.ppf(0.975, loc=point_estimate, scale=std_error)
print((lower, upper))
(7.481961792328933, 7.544943991671067)
Échantillonnage en Python

Passons à la pratique !

Échantillonnage en Python

Preparing Video For Download...