Python 中的假設檢定
James Chapman
Curriculum Manager, DataCamp
age_first_code_cut 將 Stack Overflow 使用者首次寫程式的年齡分類"adult" 代表 14 歲(含)之後才開始"child" 代表 14 歲之前就開始「假說」是對未知母體參數的敘述。
「假說檢定」是對兩個相互競爭的假說進行檢定。
「虛無假說($H_{0}$)」是現有看法。
「對立假說($H_{A}$)」是研究者提出的新挑戰觀點。
以本問題為例:
「顯著水準」是用於假說檢定的「超越合理懷疑」。

假說檢定會檢查樣本統計量是否落在「虛無分配」的尾端。
| 檢定 | 尾端 |
|---|---|
| 對立假說「不同於」虛無 | 雙尾 |
| 對立假說「大於」虛無 | 右尾 |
| 對立假說「小於」虛無 | 左尾 |
$H_{A}$:資料科學家兒時開始寫程式的比例「大於」35%
這是「右尾」檢定。

「p 值」:在虛無假說為真時,得到觀察結果的機率。
prop_child_samp = (stack_overflow['age_first_code_cut'] == "child").mean()
0.39141972578505085
prop_child_hyp = 0.35
std_error = np.std(first_code_boot_distn, ddof=1)
0.010351057228878566
z_score = (prop_child_samp - prop_child_hyp) / std_error
4.001497129152506
norm.cdf() 是 scipy.stats 的常態 CDF。norm.cdf()。1 - norm.cdf()。
from scipy.stats import norm
1 - norm.cdf(z_score, loc=0, scale=1)
3.1471479512323874e-05
Python 中的假設檢定