统计显著性

R 中的假设检验

Richie Cotton

Data Evangelist at DataCamp

p 值回顾

  • p 值量化对原假设的证据。
  • p 值大 → 不拒绝原假设。
  • p 值小 → 拒绝原假设。
  • 截止点在哪里?
R 中的假设检验

显著性水平

假设检验的"显著性水平"($\alpha$)是"超出合理怀疑"的阈值。

  • 常见 $\alpha$:0.10.050.01
  • 若 $p \le \alpha$,拒绝 $H_{0}$;否则不拒绝 $H_{0}$。
  • $\alpha$ 应在检验前设定。
R 中的假设检验

计算 p 值

alpha <- 0.05
prop_child_samp <- stack_overflow %>%
  summarize(
    point_estimate = mean(age_first_code_cut == "child")
  ) %>%
  pull(point_estimate)
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
p_value <= alpha
TRUE

p_value 小于等于 alpha,因此拒绝 $H_{0}$,接受 $H_{A}$。

数据科学家童年开始编程的比例高于 35%。

R 中的假设检验

置信区间

当显著性水平为 0.05 时,常用置信区间为 1 - 0.05 = 0.95

conf_int <- first_code_boot_distn %>%
  summarize(
    lower = quantile(first_code_child_rate, 0.025),
    upper = quantile(first_code_child_rate, 0.975)
  )
# A tibble: 1 x 2
  lower upper
  <dbl> <dbl>
1 0.369 0.407
R 中的假设检验

错误类型

确实未犯罪 确实犯罪
判无罪 正确 侥幸脱罪
判有罪 错判 正确

 

真实 $H_{0}$ 真实 $H_{A}$
选择 $H_{0}$ 正确 假阴性
选择 $H_{A}$ 假阳性 正确

 

假阳性为Ⅰ类错误;假阴性为Ⅱ类错误。

R 中的假设检验

示例中的可能错误

若 $p \le \alpha$,则拒绝 $H_{0}$:

  • 可能出现假阳性(Ⅰ类)错误:我们认为数据科学家更常在童年开始编程,但实际并非如此。

若 $ p \gt \alpha$,则不拒绝 $H_{0}$:

  • 可能出现假阴性(Ⅱ类)错误:我们认为数据科学家与软件工程师童年开始编程的比例相同,但实际更高。
R 中的假设检验

让我们来练习!

R 中的假设检验

Preparing Video For Download...