검정력과 표본 크기

R로 배우는 A/B Testing

Lauryn Burleigh

Data Scientist

검정력 정의

  • 귀무가설이 거짓일 때 이를 기각할 확률
  • 귀무가설을 기각하지 않는 제 II종 오류를 피함
  • 바람직함: 제 II종 오류율 낮고 검정력 높음

왼쪽은 귀무가설 정규분포, 오른쪽은 대립가설 정규분포로 부분적으로 겹칩니다. 점선은 분포가 겹치는 p-값을 표시합니다. 대립가설 분포에서 선의 왼쪽은 제 II종 오류, 오른쪽은 검정력을 나타냅니다.

R로 배우는 A/B Testing

검정력의 이점

검정의 유용성

  • 기각되어야 할 때 귀무가설 기각

왼쪽은 귀무가설 정규분포, 오른쪽은 대립가설 정규분포로 부분적으로 겹칩니다. 점선은 분포가 겹치는 p-값을 표시합니다. 대립가설 분포에서 선의 왼쪽은 제 II종 오류, 오른쪽은 검정력을 나타냅니다.

검정력

  • 필요한 표본 크기 산정
  • 결과 신뢰성 확인
R로 배우는 A/B Testing

표본 크기

  • 추정 효과 크기
  • 추정 검정력(일반적으로 0.8)
  • 유의수준 알파(일반적으로 0.05)

겹치는 분포: t-값 x축. 표본 크기가 작을수록 분포가 넓고, 유의성에 더 큰 t-값이 필요함을 보여줍니다.

library(pwr)
pwr.t.test(d = .8, power = 0.8,

sig.level = 0.05,
type = "one.sample",
alternative = "two.sided")
     One-sample t test power calculation 
              n = 14.30276
              d = 0.8
      sig.level = 0.05
          power = 0.8
    alternative = two.sided
R로 배우는 A/B Testing

효과 크기

  • 기대 효과 크기
  • 대조군 평균 - 실험군 평균

왼쪽은 귀무가설 정규분포, 오른쪽은 대립가설 정규분포로 부분적으로 겹칩니다. 점선은 분포가 겹치는 p-값을 표시합니다. 대립가설 분포에서 선의 왼쪽은 제 II종 오류, 오른쪽은 검정력을 나타냅니다. 두 분포의 정점 차이가 효과 크기를 의미하며 빨간 막대로 표시됩니다.

분석 전

효과 크기 추정:

  • 배경 정보
  • 예비 데이터

 

분석 후

효과 크기 추정:

  • 전체 데이터셋
R로 배우는 A/B Testing

검정력 분석

검정력이 높을수록 귀무가설이 거짓일 때 올바르게 기각할 확률이 큽니다

필요한 세 요소:

  • 표본 크기
  • 효과 크기
  • 유의수준(알파)
library(pwr)
pwr.t.test(n = 20, sig.level = 0.045, 
           d = .81, type = "one.sample")
     One-sample t test power calculation 
              n = 20
              d = 0.81
      sig.level = 0.045
          power = 0.9223189
    alternative = two.sided
R로 배우는 A/B Testing

피자 분포

유사한 분포

유의한 차이 없음

두 히스토그램(페퍼로니: 분홍, 치즈: 파랑). x축은 얻은 값, y축은 빈도. 두 분포의 봉우리가 x축에서 가깝습니다.

다른 분포

유의한 차이일 가능성 큼

두 히스토그램(페퍼로니: 분홍, 치즈: 파랑). x축은 얻은 값, y축은 빈도. 두 분포의 봉우리가 x축에서 떨어져 있습니다.

R로 배우는 A/B Testing

피자 가설

분홍색 귀무가설 분포(평균 차 0)와 파란색 대립가설 분포(평균 차 3.5). 임계 기각값은 1.64에서 수직선으로 표시.

  • 유사: 기각값 왼쪽
  • 차이 있음: 기각값 오른쪽
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
R로 배우는 A/B Testing

피자 검정력

분홍색 귀무가설 분포(평균 차 0)와 파란색 대립가설 분포(평균 차 3.5). 임계 기각값은 1.64에서 수직선으로 표시.

  • 유사: 기각값 왼쪽
  • 차이 있음: 기각값 오른쪽
  • 검정력: 동일한 토핑 분포라고 잘못 판단하지 않을 확률(제 II종 오류)
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
R로 배우는 A/B Testing

연습해 봅시다!

R로 배우는 A/B Testing

Preparing Video For Download...