Testowanie hipotez w R
Richie Cotton
Data Evangelist at DataCamp
age_first_code_cut klasyfikuje, kiedy użytkownik Stack Overflow zaczął programować"adult" oznacza, że zaczął w wieku 14 lat lub później"child" oznacza, że zaczął przed 14. rokiem życiaHipoteza to twierdzenie o nieznanym parametrze populacji.
Test hipotez to test dwóch konkurujących hipotez.
Hipoteza zerowa ($H_{0}$) to dotychczasowy „mistrz”.
Hipoteza alternatywna ($H_{A}$) to nowy „pretendent” badacza.
Dla naszego problemu
Poziom istotności to „ponad wszelka wątpliwość” w testowaniu hipotez.

Testy hipotez sprawdzają, czy statystyki z próby leżą w ogonach rozkładu zerowego.
| Test | Ogony |
|---|---|
| alternatywna różna od zerowej | dwustronny |
| alternatywna większa od zerowej | prawostronny |
| alternatywna mniejsza od zerowej | lewostronny |
$H_{A}$: Odsetek data scientistów zaczynających programować jako dzieci jest większy niż 35%.
Nasza hipoteza alternatywna używa „większy niż”, więc potrzebujemy testu prawostronnego.
Wartość p to
prawdopodobieństwo zaobserwowania statystyki testu
równie lub bardziej skrajnej
niż ta zaobserwowana w naszej oryginalnej próbie,
przy założeniu, że hipoteza zerowa jest prawdziwa.
prop_child_samp <- stack_overflow %>%
summarize(point_estimate = mean(age_first_code_cut == "child")) %>%
pull(point_estimate)
0.388
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
3.956
pnorm() to dystrybuanta rozkładu normalnego.lower.tail = TRUE.lower.tail = FALSE.
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
Testowanie hipotez w R