Перевірка гіпотез у R
Richie Cotton
Data Evangelist at DataCamp
age_first_code_cut класифікує, коли користувач Stack Overflow уперше почав програмувати"adult" — почали у 14 років або пізніше"child" — почали до 14 роківГіпотеза — це твердження про невідомий параметр генеральної сукупності.
Перевірка гіпотез — це тест двох конкуруючих гіпотез.
Нульова гіпотеза ($H_{0}$) — чинна «чемпіонка».
Альтернативна гіпотеза ($H_{A}$) — нова «претендентка» дослідника.
Для нашої задачі
Рівень значущості — це аналог «поза розумним сумнівом» для перевірки гіпотез.

Тести гіпотез визначають, чи лежать статистики вибірки в «хвостах» нульового розподілу.
| Тест | Хвости |
|---|---|
| альтернатива відрізняється від нуля | двобічний |
| альтернатива більша за нуль | правобічний |
| альтернатива менша за нуль | лівобічний |
$H_{A}$: Частка дата-сайєнтистів, які почали програмувати в дитинстві, більша за 35%.
Наша альтернатива — «більша за», тож потрібен правобічний тест.
p-значення — це
ймовірність спостерігати статистику тесту
таку ж або ще екстремальнішу
ніж у нашій початковій вибірці,
за умови, що нульова гіпотеза істинна.
prop_child_samp <- stack_overflow %>%
summarize(point_estimate = mean(age_first_code_cut == "child")) %>%
pull(point_estimate)
0.388
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
3.956
pnorm() — це CDF нормального розподілу.lower.tail = TRUE.lower.tail = FALSE.
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
Перевірка гіпотез у R