Le théorème central limite

Introduction aux statistiques avec R

Maggie Matsui

Content Developer, DataCamp

Lancer le dé 5 fois

die <- c(1, 2, 3, 4, 5, 6)

# Lancer 5 fois sample_of_5 <- sample(die, 5, replace = TRUE) sample_of_5
1 3 4 1 1
mean(sample_of_5)
2.0

 

dé à six faces

Introduction aux statistiques avec R

Lancer le dé 5 fois

# Lancer 5 fois et prendre la moyenne
sample(die, 5, replace = TRUE) %>% mean()
4.4
sample(die, 5, replace = TRUE) %>% mean()
3.8
Introduction aux statistiques avec R

Lancer le dé 5 fois, 10 fois

Répéter 10 fois :

  • Lancer 5 fois
  • Prendre la moyenne

 

sample_means <- replicate(10, sample(die, 5, replace = TRUE) %>% mean())

sample_means
3.8 4.0 3.8 3.6 3.2 4.8 2.6 3.0 2.6 2.0
Introduction aux statistiques avec R

Distributions d'échantillonnage

Distribution d'échantillonnage de la moyenne d'échantillon

histogramme de 10 moyennes d'échantillon

Introduction aux statistiques avec R

100 moyennes d'échantillon

replicate(100, sample(die, 5, replace = TRUE) %>% mean())
2.8 3.2 1.8 4.6 4.0 2.8 4.4 2.4 3.4 2.8 4.2 3.4 ... 2.2 3.8 3.6 3.8 4.4 4.8 2.4

histogramme de 100 moyennes d'échantillon

Introduction aux statistiques avec R

1000 moyennes d'échantillon

sample_means <- replicate(1000, sample(die, 5, replace = TRUE) %>% mean())

histogramme de 1000 moyennes d'échantillon

Introduction aux statistiques avec R

Théorème central limite

La distribution d'échantillonnage d'une statistique se rapproche de la loi normale quand le nombre d'essais augmente.

histogrammes de 10, 100 et 1000 moyennes d'échantillon, où plus il y en a, plus la distribution ressemble à une courbe en cloche

 

* Les échantillons doivent être aléatoires et indépendants

Introduction aux statistiques avec R

Écart type et TCL

replicate(1000, sample(die, 5, replace = TRUE) %>% sd())

Distribution de 1000 écarts types d'échantillons de 5 lancers de dé

Introduction aux statistiques avec R

Proportions et le TCL

sales_team <- c("Amir", "Brian", "Claire", "Damian")

sample(sales_team, 10, replace = TRUE)
"Claire" "Brian"  "Brian"  "Brian"  "Damian" "Damian" "Brian"  "Brian" 
"Amir"   "Amir"
sample(sales_team, 10, replace = TRUE)
"Amir"   "Amir"   "Claire" "Amir"   "Amir"   "Brian"  "Amir"   "Claire" 
"Claire" "Claire"
Introduction aux statistiques avec R

Distribution d'échantillonnage de la proportion

La distribution des proportions d'échantillon a aussi une allure normale

Introduction aux statistiques avec R

Moyenne de la distribution d'échantillonnage

# Estimer la valeur attendue du dé
mean(sample_means)
3.48
# Estimer la proportion de « Claire »
mean(sample_props)
0.26
  • Estimer les caractéristiques d'une distribution sous-jacente inconnue

Distribution d'échantillonnage des moyennes avec une ligne pointillée au centre  

  • Mieux estimer les caractéristiques de grandes populations
Introduction aux statistiques avec R

Passons à la pratique !

Introduction aux statistiques avec R

Preparing Video For Download...