Échantillonnage et estimations ponctuelles

Échantillonnage en R

Richie Cotton

Data Evangelist at DataCamp

Estimer la population de la France

Une carte de la France.

Un recensement demande à chaque ménage combien de personnes y vivent.

Échantillonnage en R

Il y a beaucoup de monde en France

Une carte de la France avec des icônes de personnes.

Les recensements coûtent très cher !

Échantillonnage en R

Échantillonner des ménages

Une carte de la France avec des icônes de personnes, dont certaines sont en surbrillance.

Il est moins coûteux d'interroger un petit nombre de ménages et d'utiliser des statistiques pour estimer l'ensemble de la population.

Travailler avec un sous-ensemble de la population s'appelle l'« échantillonnage ».

Échantillonnage en R

Population vs échantillon

La « population » est l'ensemble complet des données.

  • Elle ne se limite pas aux personnes.
  • En général, vous ne connaissez pas toute la population.

L'« échantillon » est le sous-ensemble sur lequel vous calculez.

Échantillonnage en R

Ensemble d'évaluation de cafés

total_cup_points variety country_of_origin aroma flavor aftertaste body balance
90.58 NA Ethiopia 8.67 8.83 8.67 8.50 8.42
89.92 Other Ethiopia 8.75 8.67 8.50 8.42 8.42
... ... ... ... ... ... ... ...
73.75 NA Vietnam 6.75 6.67 6.5 6.92 6.83
  • Chaque ligne représente 1 café.
  • 1138 lignes.
  • Nous traiterons ceci comme la population.
Échantillonnage en R

Points vs saveur : population

pts_vs_flavor_pop <- coffee_ratings %>% 
  select(total_cup_points, flavor)
dim(pts_vs_flavor_pop)
1338    2
     total_cup_points flavor
1               90.58   8.83
2               89.92   8.67
3               89.75   8.50
4               89.00   8.58
...              ...     ...
1335            78.08   7.67
1336            77.17   7.33
1337            75.08   6.83
1338            73.75   6.67
Échantillonnage en R

Points vs saveur : échantillon de 10 lignes

pts_vs_flavor_samp <- coffee_ratings %>% 
  select(total_cup_points, flavor) %>%
  slice_sample(n = 10)
dim(pts_vs_flavor_samp)
10  2
   total_cup_points flavor
1             82.25   7.58
2             83.50   7.67
3             80.50   7.17
4             79.33   7.17
5             83.83   7.58
6             84.17   7.75
7             83.67   8.17
8             81.92   7.50
9             82.67   7.58
10            83.42   7.67
Échantillonnage en R

Échantillonnage en R de base

Utilisez slice_sample() pour les trames de données et sample() pour les vecteurs.

cup_points_samp <- sample(coffee_ratings$total_cup_points, size = 10)
88.25 83.83 83.17 82.67 84.67 83.42 73.67 86.00 81.58 80.92
Échantillonnage en R

Paramètres de population et estimations ponctuelles

Un « paramètre de population » est un calcul effectué sur l'ensemble de la population.

mean(pts_vs_flavor_pop$total_cup_points)
82.15

Une « estimation ponctuelle » ou « statistique d'échantillon » est un calcul effectué sur l'échantillon.

mean(cup_points_samp)
82.82
Échantillonnage en R

Estimations ponctuelles avec dplyr

pts_vs_flavor_pop %>% 
  summarize(mean_flavor = mean(flavor)) 
  mean_flavor
1       7.526
pts_vs_flavor_samp %>% 
  summarize(mean_flavor = mean(flavor)) 
  mean_flavor
1       7.716
Échantillonnage en R

Passons à la pratique !

Échantillonnage en R

Preparing Video For Download...