Le théorème central limite

Introduction à la statistique en Python

Maggie Matsui

Content Developer, DataCamp

Lancer le dé 5 fois

die = pd.Series([1, 2, 3, 4, 5, 6])

# Lancer 5 fois samp_5 = die.sample(5, replace=True) print(samp_5)
array([3, 1, 4, 1, 1])
np.mean(samp_5)
2.0

 

dé à six faces

Introduction à la statistique en Python

Lancer le dé 5 fois

# Lancer 5 fois et calculer la moyenne
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
4.4
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
3.8
Introduction à la statistique en Python

Lancer le dé 5 fois, 10 fois

Répéter 10 fois :

  • Lancer 5 fois
  • Calculer la moyenne
sample_means = []

for i in range(10):
samp_5 = die.sample(5, replace=True) sample_means.append(np.mean(samp_5))
print(sample_means)
[3.8, 4.0, 3.8, 3.6, 3.2, 4.8, 2.6,
3.0, 2.6, 2.0]
Introduction à la statistique en Python

Distributions d'échantillonnage

Distribution d'échantillonnage de la moyenne d'échantillon

histogramme de 10 moyennes d'échantillon

Introduction à la statistique en Python

100 moyennes d'échantillon

sample_means = []
for i in range(100):
    sample_means.append(np.mean(die.sample(5, replace=True)))

histogramme de 100 moyennes d'échantillon

Introduction à la statistique en Python

1000 moyennes d'échantillon

sample_means = []
for i in range(1000):
    sample_means.append(np.mean(die.sample(5, replace=True)))

histogramme de 1000 moyennes d'échantillon

Introduction à la statistique en Python

Théorème central limite

La distribution d'échantillonnage d'une statistique se rapproche d'une loi normale quand le nombre d'essais augmente.

histogrammes de 10, 100 et 1000 moyennes d'échantillon, où un plus grand nombre de moyennes d'échantillon donne une distribution plus en cloche

 

* Les échantillons doivent être aléatoires et indépendants

Introduction à la statistique en Python

Écart type et TCL

sample_sds = []
for i in range(1000):
  sample_sds.append(np.std(die.sample(5, replace=True)))

Distribution de 1000 écarts types d'échantillons de 5 lancers de dé

Introduction à la statistique en Python

Proportions et TCL

sales_team = pd.Series(["Amir", "Brian", "Claire", "Damian"])

sales_team.sample(10, replace=True)
array(['Claire', 'Damian', 'Brian', 'Damian', 'Damian', 'Amir', 'Amir', 'Amir', 
      'Amir', 'Damian'], dtype=object)
sales_team.sample(10, replace=True)
array(['Brian', 'Amir', 'Brian', 'Claire', 'Brian', 'Damian', 'Claire', 'Brian', 
      'Claire', 'Claire'], dtype=object)
Introduction à la statistique en Python

Distribution d'échantillonnage de la proportion

La distribution des proportions d'échantillon paraît aussi normale

Introduction à la statistique en Python

Moyenne de la distribution d'échantillonnage

# Estimer la valeur attendue du dé
np.mean(sample_means)
3.48
# Estimer la proportion de « Claire »
np.mean(sample_props)
0.26

Distribution d'échantillonnage des moyennes avec ligne pointillée au centre  

  • Estimer les caractéristiques d'une distribution sous-jacente inconnue
  • Estimer plus facilement les caractéristiques de grandes populations
Introduction à la statistique en Python

Passons à la pratique !

Introduction à la statistique en Python

Preparing Video For Download...