Проверка гипотез в R
Richie Cotton
Data Evangelist at DataCamp
age_first_code_cut классифицирует, когда пользователь Stack Overflow начал программировать."adult" — начал в 14 лет или позже."child" — начал до 14 лет.Гипотеза — это утверждение о неизвестном параметре генеральной совокупности.
Проверка гипотез — это сравнение двух конкурирующих гипотез.
Нулевая гипотеза ($H_{0}$) — существующая «общепринятая» идея.
Альтернативная гипотеза ($H_{A}$) — новая идея исследователя.
Для нашей задачи
Уровень значимости — это «разумное сомнение» в проверке гипотез.

Проверка гипотез определяет, попадает ли выборочная статистика в хвосты нулевого распределения.
| Критерий | Хвосты |
|---|---|
| альтернативная отличается от нулевой | двусторонний |
| альтернативная больше нулевой | правосторонний |
| альтернативная меньше нулевой | левосторонний |
$H_{A}$: доля специалистов по данным, начавших программировать в детстве, больше 35%.
Альтернативная гипотеза использует «больше», поэтому нам нужен правосторонний критерий.
p-value — это
вероятность наблюдать тестовую статистику
столь же экстремальную или более экстремальную,
чем та, что получена в исходной выборке,
при условии, что нулевая гипотеза верна.
prop_child_samp <- stack_overflow %>%
summarize(point_estimate = mean(age_first_code_cut == "child")) %>%
pull(point_estimate)
0.388
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
3.956
pnorm() — функция нормального CDF.lower.tail = TRUE.lower.tail = FALSE.
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
Проверка гипотез в R