統計顯著性

R 中的假設檢定

Richie Cotton

Data Evangelist at DataCamp

p-value 複習

  • p-value 衡量虛無假設的支持力度。
  • p-value 大 → 無法拒絕虛無假設。
  • p-value 小 → 拒絕虛無假設。
  • 臨界值在哪裡?
R 中的假設檢定

Significance level

假設檢定的「顯著水準」($\alpha$)是「超越合理懷疑」的門檻。

  • 常見的 $\alpha$ 值有 0.10.050.01
  • 若 $p \le \alpha$,拒絕 $H_{0}$;否則無法拒絕 $H_{0}$。
  • $\alpha$ 應在執行檢定「之前」設定。
R 中的假設檢定

計算 p-value

alpha <- 0.05
prop_child_samp <- stack_overflow %>%
  summarize(
    point_estimate = mean(age_first_code_cut == "child")
  ) %>%
  pull(point_estimate)
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
p_value <= alpha
TRUE

p_value 小於或等於 alpha,所以拒絕 $H_{0}$,接受 $H_{A}$。

資料科學家在兒時開始學程式的比例大於 35%。

R 中的假設檢定

信賴區間

在顯著水準 0.05 下,常用信賴區間為 1 - 0.05 = 0.95

conf_int <- first_code_boot_distn %>%
  summarize(
    lower = quantile(first_code_child_rate, 0.025),
    upper = quantile(first_code_child_rate, 0.975)
  )
# A tibble: 1 x 2
  lower upper
  <dbl> <dbl>
1 0.369 0.407
R 中的假設檢定

錯誤類型

事實未犯罪 事實有犯罪
判決無罪 正確 逍遙法外
判決有罪 錯判入罪 正確

 

真實 $H_{0}$ 真實 $H_{A}$
選擇 $H_{0}$ 正確 偽陰性
選擇 $H_{A}$ 偽陽性 正確

 

偽陽性為「第一類錯誤」(Type I);偽陰性為「第二類錯誤」(Type II)。

R 中的假設檢定

本例可能的錯誤

若 $p \le \alpha$,我們會拒絕 $H_{0}$:

  • 可能發生偽陽性(第一類)錯誤:我們以為資料科學家在兒時開始學程式的比例更高,但其實沒有。

若 $ p \gt \alpha$,我們無法拒絕 $H_{0}$:

  • 可能發生偽陰性(第二類)錯誤:我們以為資料科學家與軟體工程師在兒時學程式的比例相同,但其實資料科學家更高。
R 中的假設檢定

一起來練習吧!

R 中的假設檢定

Preparing Video For Download...