Porównywanie średnich testem t

Wnioskowanie statystyczne dla danych liczbowych w R

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

Bardziej standardowa miara wynagrodzenia

Zamiast porównywać średnie roczne income, porównaj średnie hrly_rate:

  • przyjmij 52 tygodnie w roku
  • hrly_rate = income / (hrs_work * 52)
Wnioskowanie statystyczne dla danych liczbowych w R

Pytanie badawcze i hipotezy

Czy dane dostarczają przekonujących dowodów na różnicę między średnią stawką godzinową obywateli i nieobywateli w USA?

Niech $\mu = $ średnia stawka godzinowa

$H_0: \mu_{citizen} = \mu_{non-citizen}$

$H_A: \mu_{citizen} \ne \mu_{non-citizen}$

Wnioskowanie statystyczne dla danych liczbowych w R

Statystyki opisowe

acs12 %>%
  filter(!is.na(hrly_rate)) %>%
  group_by(citizen) %>%
  summarise(x_bar = round(mean(hrly_rate), 2),
            s = round(sd(hrly_rate), 2),
            n = length(hrly_rate)) 
  citizen  x_bar      s   n
1 no       21.19  34.50  58
2 yes      18.52  24.73 901
Wnioskowanie statystyczne dla danych liczbowych w R

Przeprowadzanie testu

t.test(hrly_rate ~ citizen, data = acs12, null = 0, 
       alternative = "two.sided")
  • Hipoteza zerowa:
    • $H_0: \mu_{citizen} = \mu_{non-citizen}$
    • $H_0: \mu_{citizen} - \mu_{non-citizen} = 0$ $\rightarrow$ null = 0
  • $H_A: \mu_{citizen} \ne \mu_{non-citizen}$ $\rightarrow$ alternative = "two.sided"
Wnioskowanie statystyczne dla danych liczbowych w R

Przeprowadzanie testu

t.test(hrly_rate ~ citizen, data = acs12, null = 0, 
       alternative = "two.sided")
    Welch Two Sample t-test
data:  hrly_rate by citizen
t = 0.58058, df = 60.827, p-value = 0.5637
alternative hypothesis: true difference in means is not equal to 0
95 percent confidence interval:
 -6.53483 11.88170
sample estimates:
 mean in group no mean in group yes 
         21.19494          18.52151 
Wnioskowanie statystyczne dla danych liczbowych w R

Warunki

  • Niezależność:
    • Obserwacje w każdej próbie powinny być niezależne od siebie.
    • Obie próby powinny być niezależne od siebie.
  • Liczebność / skośność: Im bardziej skośne są dane, tym większa liczebność próby jest wymagana do uzyskania symetrycznego rozkładu próbkowania.

chp3-vid3-hrly-rate-citizen

Wnioskowanie statystyczne dla danych liczbowych w R

Czas na ćwiczenia!

Wnioskowanie statystyczne dla danych liczbowych w R

Preparing Video For Download...