Testy pro proporci jednoho výběru

Testování hypotéz v R

Richie Cotton

Data Evangelist at DataCamp

Rekapitulace kapitoly 1

  • Je tvrzení o neznámé populační proporci přijatelné?
  • Směrodatná chyba výběrové statistiky vypočtena pomocí bootstrapového rozdělení.
  • To bylo použito k výpočtu standardizované testové statistiky, ...
  • která byla použita k výpočtu p-hodnoty, ...
  • která rozhodla, která hypotéza je smysluplnější.
  • Zde vypočítáme testovou statistiku bez bootstrapového rozdělení.
Testování hypotéz v R

Standardizovaná testová statistika pro proporce

$p$: populační proporce (neznámý populační parametr)

$\hat{p}$: výběrová proporce (výběrová statistika)

$p_{0}$: hypotetická populační proporce

$$ z = \frac{\hat{p} - \text{mean}(\hat{p})}{\text{standard error}(\hat{p})} = \frac{\hat{p} - p}{\text{standard error}(\hat{p})} $$

Při platnosti $H_{0}$ platí $p = p_{0}$, tedy

$$ z = \dfrac{\hat{p} - p_{0}}{\text{standard error}(\hat{p})} $$

Testování hypotéz v R

Jednodušší výpočet směrodatné chyby

$SE(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}}) \approx \sqrt{\dfrac{s_{\text{child}}^2}{n_{\text{child}}} + \dfrac{s_{\text{adult}}^2}{n_{\text{adult}}}}$

$SE_{\hat{p}} = \sqrt{\dfrac{p_{0}*(1-p_{0})}{n}}$

Při platnosti $H_{0}$,

$z = \dfrac{\hat{p} - p_{0}}{\sqrt{\dfrac{p_{0}*(1-p_{0})}{n}}}$

Využívá pouze výběrové informace ($\hat{p}$ a $n$) a hypotetický parametr ($p_{0}$).

Testování hypotéz v R

Proč z místo t?

$t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}{\sqrt{\dfrac{s_{\text{child}}^2}{n_{\text{child}}} + \dfrac{s_{\text{adult}}^2}{n_{\text{adult}}}}}$

  • $s$ je vypočteno z $\bar{x}$, takže $\bar{x}$ se používá k odhadu populačního průměru i populační směrodatné odchylky.
  • To zvyšuje nejistotu odhadu populačního parametru.
  • t-rozdělení má těžší chvosty než normální rozdělení.
  • To přidává vyšší míru opatrnosti.
  • $\hat{p}$ se vyskytuje pouze v čitateli, proto jsou z-skóre vhodná.
Testování hypotéz v R

Věkové kategorie Stack Overflow

$H_{0}$: Podíl uživatelů SO mladších třiceti let se rovná 0,5.

$H_{A}$: Podíl uživatelů SO mladších třiceti let se nerovná 0,5.

alpha <- 0.01
stack_overflow %>% 
  count(age_cat)
# A tibble: 2 x 2
  age_cat         n
  <chr>       <int>
1 At least 30  1050
2 Under 30     1216
Testování hypotéz v R

Proměnné pro z

p_hat <- stack_overflow %>%
  summarize(prop_under_30 = mean(age_cat == "Under 30")) %>%
  pull(prop_under_30)
0.5366
p_0 <- 0.50
n <- nrow(stack_overflow)
2266
Testování hypotéz v R

Výpočet z-skóre

$z = \dfrac{\hat{p} - p_{0}}{\sqrt{\dfrac{p_{0}*(1-p_{0})}{n}}}$

numerator <- p_hat - p_0
denominator <- sqrt(p_0 * (1 - p_0) / n)
z_score <- numerator / denominator
3.487
Testování hypotéz v R

Výpočet p-hodnoty

Distribuční funkce normálního rozdělení. Část křivky vlevo od -2 je červená, část vpravo od 2 je zelená. Levostranný ("menší než")

p_value <- pnorm(z_score) 

Pravostranný ("větší než")

p_value <- pnorm(z_score, lower.tail = FALSE)

Oboustranný ("různý od")

p_value <- pnorm(z_score) + 
  pnorm(z_score, lower.tail = FALSE)
p_value <- 2 * pnorm(z_score)
0.000244
p_value <= alpha
TRUE
Testování hypotéz v R

Pojďme procvičovat!

Testování hypotéz v R

Preparing Video For Download...