Comparer des moyennes avec un test t

Inférence pour des données numériques en R

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

Une mesure (plus) standard de la rémunération

Au lieu de comparer le income annuel moyen, comparez le hrly_rate moyen :

  • supposez 52 semaines par année
  • hrly_rate = income / (hrs_work * 52)
Inférence pour des données numériques en R

Question de recherche et hypothèses

Les données fournissent-elles une preuve convaincante d'une différence entre le taux horaire moyen des citoyens et des non-citoyens aux É.-U. ?

Soit $\mu = $ taux horaire moyen

$H_0: \mu_{citizen} = \mu_{non-citizen}$

$H_A: \mu_{citizen} \ne \mu_{non-citizen}$

Inférence pour des données numériques en R

Statistiques sommaires

acs12 %>%
  filter(!is.na(hrly_rate)) %>%
  group_by(citizen) %>%
  summarise(x_bar = round(mean(hrly_rate), 2),
            s = round(sd(hrly_rate), 2),
            n = length(hrly_rate)) 
  citizen  x_bar      s   n
1 no       21.19  34.50  58
2 yes      18.52  24.73 901
Inférence pour des données numériques en R

Réaliser le test

t.test(hrly_rate ~ citizen, data = acs12, null = 0, 
       alternative = "two.sided")
  • Nulle :
    • $H_0: \mu_{citizen} = \mu_{non-citizen}$
    • $H_0: \mu_{citizen} - \mu_{non-citizen} = 0$ $\rightarrow$ null = 0
  • $H_A: \mu_{citizen} \ne \mu_{non-citizen}$ $\rightarrow$ alternative = "two.sided"
Inférence pour des données numériques en R

Réaliser le test

t.test(hrly_rate ~ citizen, data = acs12, null = 0, 
       alternative = "two.sided")
    Welch Two Sample t-test
data:  hrly_rate by citizen
t = 0.58058, df = 60.827, p-value = 0.5637
alternative hypothesis: true difference in means is not equal to 0
95 percent confidence interval:
 -6.53483 11.88170
sample estimates:
 mean in group no mean in group yes 
         21.19494          18.52151 
Inférence pour des données numériques en R

Conditions

  • Indépendance :
    • Les observations dans chaque échantillon doivent être indépendantes.
    • Les deux échantillons doivent être indépendants l'un de l'autre.
  • Taille de l'échantillon / asymétrie : plus les données originales sont asymétriques, plus il faut une grande taille d'échantillon pour obtenir une distribution d'échantillonnage symétrique.

chp3-vid3-hrly-rate-citizen

Inférence pour des données numériques en R

Passons à la pratique !

Inférence pour des données numériques en R

Preparing Video For Download...