Kiểm định giả thuyết trong R
Richie Cotton
Data Evangelist at DataCamp
age_first_code_cut phân loại thời điểm người dùng Stack Overflow bắt đầu lập trình"adult" nghĩa là bắt đầu từ 14 tuổi trở lên"child" nghĩa là bắt đầu trước 14 tuổiGiả thuyết là phát biểu về một tham số quần thể chưa biết.
Kiểm định giả thuyết là kiểm định hai giả thuyết cạnh tranh.
Giả thuyết không ($H_{0}$) là ý tưởng "đương kim vô địch".
Giả thuyết đối ($H_{A}$) là ý tưởng "thách thức" mới của nhà nghiên cứu.
Với bài toán của ta
Mức ý nghĩa là phiên bản "vượt quá nghi ngờ hợp lý" trong kiểm định giả thuyết.

Kiểm định giả thuyết kiểm tra xem thống kê mẫu có nằm ở phần đuôi của phân phối không hay không.
| Kiểm định | Đuôi |
|---|---|
| phương án khác không | hai đuôi |
| phương án lớn hơn không | đuôi phải |
| phương án nhỏ hơn không | đuôi trái |
$H_{A}$: Tỷ lệ nhà khoa học dữ liệu bắt đầu lập trình khi còn nhỏ lớn hơn 35%.
Phương án dùng "lớn hơn", nên cần kiểm định đuôi phải.
p-value là
xác suất quan sát được một thống kê kiểm định
cực đoan bằng hoặc hơn
so với quan sát trong mẫu gốc,
giả sử giả thuyết không đúng.
prop_child_samp <- stack_overflow %>%
summarize(point_estimate = mean(age_first_code_cut == "child")) %>%
pull(point_estimate)
0.388
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
3.956
pnorm() là CDF chuẩn.lower.tail = TRUE.lower.tail = FALSE.p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
Kiểm định giả thuyết trong R