R 中的假設檢定
Richie Cotton
Data Evangelist at DataCamp
age_first_code_cut 用來分類 Stack Overflow 使用者第一次開始寫程式的年齡。"adult" 代表 14 歲(含)之後開始。"child" 代表 14 歲之前開始。「假設」是對未知母體參數的陳述。
「假設檢定」是對兩個彼此競爭的假設進行檢驗。
「虛無假設($H_{0}$)」是現有的「衛冕者」想法。
「對立假設($H_{A}$)」是研究者提出的「挑戰者」想法。
對於我們的問題:
「顯著水準」對應於假設檢定中的「排除合理懷疑」。

假設檢定會判斷樣本統計量是否落在「虛無」分配的尾部。
| 檢定 | 尾部 |
|---|---|
| 對立假設「不同於」虛無假設 | 雙尾 |
| 對立假設「大於」虛無假設 | 右尾 |
| 對立假設「小於」虛無假設 | 左尾 |
$H_{A}$:資料科學家童年開始寫程式的比例「大於」35%。
我們的對立假設使用「大於」,因此需要「右尾」檢定。
p 值是:
在假定虛無假設為真的前提下,
觀察到的檢定統計量「至少同樣極端或更極端」
相對於我們原始樣本所觀察到的情況的機率,
前提是虛無假設為真。
prop_child_samp <- stack_overflow %>%
summarize(point_estimate = mean(age_first_code_cut == "child")) %>%
pull(point_estimate)
0.388
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
3.956
pnorm() 是常態分配的 CDF。lower.tail = TRUE。lower.tail = FALSE。
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
R 中的假設檢定