통계적 유의성

R로 하는 가설 검정

Richie Cotton

Data Evangelist at DataCamp

p-값 복습

  • p-값은 귀무가설에 대한 근거를 정량화합니다.
  • p-값이 크면 → 귀무가설 기각 실패.
  • p-값이 작으면 → 귀무가설 기각.
  • 기준점은 어디인가요?
R로 하는 가설 검정

유의 수준

가설 검정의 유의 수준($\alpha$)은 "합리적인 의심의 여지 없음"에 대한 임계값입니다.

  • $\alpha$의 일반적인 값은 0.1, 0.05, 0.01입니다.
  • $p \le \alpha$이면 $H_{0}$을 기각하고, 그렇지 않으면 기각에 실패합니다.
  • $\alpha$는 가설 검정 수행 이전에 설정해야 합니다.
R로 하는 가설 검정

p-값 계산

alpha <- 0.05
prop_child_samp <- stack_overflow %>%
  summarize(
    point_estimate = mean(age_first_code_cut == "child")
  ) %>%
  pull(point_estimate)
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
p_value <= alpha
TRUE

p_valuealpha 이하이므로 $H_{0}$을 기각하고 $H_{A}$를 채택합니다.

어린 시절부터 프로그래밍을 시작한 데이터 과학자의 비율이 35%보다 높습니다.

R로 하는 가설 검정

신뢰 구간

유의 수준 0.05의 경우, 신뢰 구간은 일반적으로 1 - 0.05 = 0.95로 설정합니다.

conf_int <- first_code_boot_distn %>%
  summarize(
    lower = quantile(first_code_child_rate, 0.025),
    upper = quantile(first_code_child_rate, 0.975)
  )
# A tibble: 1 x 2
  lower upper
  <dbl> <dbl>
1 0.369 0.407
R로 하는 가설 검정

오류의 유형

실제로 범죄를 저지르지 않음 실제로 범죄를 저지름
무죄 판결 정확 무죄 방면
유죄 판결 부당한 유죄 판결 정확

 

실제 $H_{0}$ 실제 $H_{A}$
선택된 $H_{0}$ 정확 거짓 음성
선택된 $H_{A}$ 거짓 양성 정확

 

거짓 양성은 1종 오류, 거짓 음성은 2종 오류입니다.

R로 하는 가설 검정

예시에서 발생 가능한 오류

$p \le \alpha$인 경우 $H_{0}$을 기각합니다:

  • 거짓 양성(1종) 오류가 발생했을 수 있습니다. 데이터 과학자가 실제로는 그렇지 않음에도 불구하고, 어린 시절부터 코딩을 시작한 비율이 더 높다고 판단한 경우입니다.

$p \gt \alpha$인 경우 $H_{0}$ 기각에 실패합니다:

  • 거짓 음성(2종) 오류가 발생했을 수 있습니다. 데이터 과학자가 소프트웨어 엔지니어와 동일한 비율로 어린 시절 코딩을 시작했다고 판단했지만, 실제로는 더 높은 비율로 시작한 경우입니다.
R로 하는 가설 검정

연습해 봅시다!

R로 하는 가설 검정

Preparing Video For Download...