统计显著性

Python 假设检验

James Chapman

Curriculum Manager, DataCamp

p 值回顾

  • p 值量化对原假设的证据
  • p 值大 → 不拒绝原假设
  • p 值小 → 拒绝原假设
  • 截止点在哪里?
Python 假设检验

显著性水平

假设检验的显著性水平($\alpha$)是"超越合理怀疑"的阈值

  • 常用 $\alpha$:0.20.10.050.01
  • 若 $p \le \alpha$ 拒绝 $H_{0}$,否则不拒绝 $H_{0}$
  • $\alpha$ 应在检验前预先设定
Python 假设检验

计算 p 值

alpha = 0.05

prop_child_samp = (stack_overflow['age_first_code_cut'] == "child").mean() prop_child_hyp = 0.35
std_error = np.std(first_code_boot_distn, ddof=1)
z_score = (prop_child_samp - prop_child_hyp) / std_error
p_value = 1 - norm.cdf(z_score, loc=0, scale=1)
3.1471479512323874e-05
Python 假设检验

做出决策

alpha = 0.05

print(p_value)
3.1471479512323874e-05
p_value <= alpha
True

拒绝 $H_{0}$,支持 $H_{A}$

Python 假设检验

置信区间

显著性水平为 $\alpha$ 时,常配套选择置信水平 1 - $\alpha$

  • $\alpha=0.05$ → $95\%$ 置信区间
import numpy as np
lower = np.quantile(first_code_boot_distn, 0.025)
upper = np.quantile(first_code_boot_distn, 0.975)
print((lower, upper))
(0.37063246351172047, 0.41132242370632466)
Python 假设检验

错误类型

确实未犯罪 确实犯罪
判无罪 正确 逍遥法外
判有罪 冤假错案 正确

 

真实 $H_{0}$ 真实 $H_{A}$
选择 $H_{0}$ 正确 假阴性
选择 $H_{A}$ 假阳性 正确

 

假阳性为第一类错误;假阴性为第二类错误

Python 假设检验

示例中的可能错误

若 $p \le \alpha$,则拒绝 $H_{0}$:

  • 假阳性(第一类)错误:数据科学家童年时期开始编码的比例并未更高

若 $ p \gt \alpha$,则不拒绝 $H_{0}$:

  • 假阴性(第二类)错误:数据科学家童年时期开始编码的比例更高
Python 假设检验

Passons à la pratique !

Python 假设检验

Preparing Video For Download...