Testování hypotéz v R
Richie Cotton
Data Evangelist at DataCamp
age_first_code_cut klasifikuje, kdy uživatel Stack Overflow začal programovat“adult” znamená, že začal ve 14 letech nebo později“child” znamená, že začal před 14. rokemHypotéza je tvrzení o neznámém populačním parametru.
Test hypotézy je test dvou konkurenčních hypotéz.
Nulová hypotéza ($H_{0}$) je stávající „obhájce titulu“.
Alternativní hypotéza ($H_{A}$) je nová „vyzývající“ myšlenka výzkumníka.
Pro náš problém
Hladina významnosti je obdobou „mimo důvodných pochybností“ pro testování hypotéz.

Testy hypotéz určují, zda výběrové statistiky leží v chvostech nulového rozdělení.
| Test | Chvosty |
|---|---|
| alternativa odlišná od nuly | oboustranný |
| alternativa větší než nula | pravostranný |
| alternativa menší než nula | levostranný |
$H_{A}$: Podíl datových vědců, kteří začali programovat jako děti, je vyšší než 35 %.
Naše alternativní hypotéza používá „vyšší než“, takže potřebujeme pravostranný test.
P-hodnota je
pravděpodobnost pozorování testové statistiky
stejně extrémní nebo extrémnější
než ta pozorovaná v našem původním vzorku,
za předpokladu platnosti nulové hypotézy.
prop_child_samp <- stack_overflow %>%
summarize(point_estimate = mean(age_first_code_cut == "child")) %>%
pull(point_estimate)
0.388
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
3.956
pnorm() je distribuční funkce normálního rozdělení.lower.tail = TRUE.lower.tail = FALSE.
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
Testování hypotéz v R