Hypothesis Testing in R
Richie Cotton
Data Evangelist at DataCamp
age_first_code_cut จำแนกช่วงเวลาที่ผู้ใช้ Stack Overflow เริ่มเขียนโปรแกรม"adult" หมายถึงเริ่มเมื่ออายุ 14 ปีขึ้นไป"child" หมายถึงเริ่มก่อนอายุ 14 ปีสมมติฐาน คือข้อความเกี่ยวกับพารามิเตอร์ของประชากรที่ยังไม่ทราบค่า
การทดสอบสมมติฐาน คือการทดสอบสมมติฐานสองข้อที่แข่งขันกัน
สมมติฐานหลัก ($H_{0}$) คือแนวคิด "แชมป์เดิม" ที่มีอยู่
สมมติฐานทางเลือก ($H_{A}$) คือแนวคิด "ผู้ท้าชิง" ของนักวิจัย
สำหรับปัญหาของเรา
ระดับนัยสำคัญ คือ "เกินข้อสงสัยอันสมเหตุสมผล" ในบริบทของการทดสอบสมมติฐาน

การทดสอบสมมติฐานพิจารณาว่าค่าสถิติจากตัวอย่างอยู่ในส่วนหางของการแจกแจง null หรือไม่
| การทดสอบ | หาง |
|---|---|
| ทางเลือก แตกต่างจาก null | สองหาง |
| ทางเลือก มากกว่า null | หางขวา |
| ทางเลือก น้อยกว่า null | หางซ้าย |
$H_{A}$: สัดส่วน data scientist ที่เริ่มเขียนโปรแกรมตั้งแต่เด็ก มากกว่า 35%
สมมติฐานทางเลือกใช้ "มากกว่า" จึงต้องใช้การทดสอบ หางขวา
p-value คือ
ความน่าจะเป็นที่จะสังเกตเห็นค่าสถิติทดสอบ
ที่รุนแรงเท่ากับหรือรุนแรงกว่า
ค่าที่สังเกตได้จากตัวอย่างเดิมของเรา
โดยสมมติว่าสมมติฐานหลักเป็นจริง
prop_child_samp <- stack_overflow %>%
summarize(point_estimate = mean(age_first_code_cut == "child")) %>%
pull(point_estimate)
0.388
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
3.956
pnorm() คือ normal CDFlower.tail = TRUElower.tail = FALSE
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
Hypothesis Testing in R