근사 지름길

R로 배우는 범주형 데이터 추론

Andrew Bray

Assistant Professor of Statistics at Reed College

신뢰구간

SE
0.009998905
SE_small_n
0.03809731
SE_low_p
0.00547912

표준오차는 다음일 때 증가합니다

  • n이 작을 때
  • p가 0.5에 가까울 때
R로 배우는 범주형 데이터 추론

근사 다이어그램 1

R로 배우는 범주형 데이터 추론

근사 다이어그램 2

R로 배우는 범주형 데이터 추론

정규분포

일명 "종 모양 곡선".

만약

  • 관측치가 독립이고
  • n이 크다면

그러면

  • $\hat{p}$는 정규분포를 따릅니다

정규분포 곡선

R로 배우는 범주형 데이터 추론

표준편차

$$\sqrt{\frac{ \hat{p} \times (1 - \hat{p})}{n}}$$

R로 배우는 범주형 데이터 추론

모형 가정 점검

"관측치가 독립"인지 어떻게 확인하나요?

  • 수집 방법에 따라 다릅니다.

"n이 큽니다"는 무엇을 의미하나요?

  • $n \times \hat{p} \gt 10$
  • $n \times(1 - \hat{p}) \gt 10$
R로 배우는 범주형 데이터 추론

표준오차 계산: 근사

p_hat <- gss2016 %>%
  summarize(mean(happy == "HAPPY")) %>%
  pull()
n <- nrow(gss2016)
c(n * p_hat, n * (1 - p_hat))
116  35
SE_approx <- sqrt(p_hat * (1 - p_hat) / n)
SE_approx
0.03418468
R로 배우는 범주형 데이터 추론

표준오차 계산: 부트스트랩

boot <- gss2016 %>%
  specify(response = happy, success = "HAPPY") %>%
  generate(reps = 500, type = "bootstrap") %>%
  calculate(stat = "prop")
SE_boot <- boot %>%
  summarize(sd(stat)) %>%
  pull()
SE_boot
0.03176741
R로 배우는 범주형 데이터 추론

표본분포

ggplot(boot, aes(x = stat)) +
  geom_density()

밀도 곡선

R로 배우는 범주형 데이터 추론

표본분포

ggplot(boot, aes(x = stat)) +
  geom_density() +
  stat_function(fun = dnorm, 
                color = "purple",
                args = 
                  list(mean = p_hat,
                       sd = SE_approx))

밀도 곡선

R로 배우는 범주형 데이터 추론

표본분포

ggplot(boot, aes(x = stat)) +
  geom_density() +
  stat_function(fun = dnorm, 
                color = "purple",
                args = 
                  list(mean = p_hat,
                       sd = SE_approx))

밀도 곡선

R로 배우는 범주형 데이터 추론

연습해 봅시다!

R로 배우는 범주형 데이터 추론

Preparing Video For Download...