效能与样本量

R 中的 A/B 测试

Lauryn Burleigh

Data Scientist

效能的定义

  • 当原假设为假时拒绝它的概率
  • 不犯"不拒绝原假设"的Ⅱ类错误
  • 理想:Ⅱ类错误率小,效能大

左侧为原假设正态分布,右侧为备择假设分布,部分重叠。虚线表示分布重叠处的 p 值。备择分布下虚线左侧为Ⅱ类错误,右侧为检验效能。

R 中的 A/B 测试

效能的益处

检验的用途

  • 在该拒绝原假设时成功拒绝

左侧为原假设正态分布,右侧为备择假设分布,部分重叠。虚线表示分布重叠处的 p 值。备择分布下虚线左侧为Ⅱ类错误,右侧为检验效能。

效能

  • 确定所需样本量
  • 评估结果是否可信
R 中的 A/B 测试

样本量

  • 预估效应量
  • 预估效能(常取 0.8)
  • 显著性水平(常取 0.05)

不同样本量的重叠分布:样本量较小时 t 分布更窄,达到显著所需的 t 值更大。x 轴为 t 值。

library(pwr)
pwr.t.test(d = .8, power = 0.8,

sig.level = 0.05,
type = "one.sample",
alternative = "two.sided")
     One-sample t test power calculation 
              n = 14.30276
              d = 0.8
      sig.level = 0.05
          power = 0.8
    alternative = two.sided
R 中的 A/B 测试

效应量

  • 预期效应量
  • 对照组均值 − 实验组均值

左侧为原假设正态分布,右侧为备择假设分布,部分重叠。虚线表示分布重叠处的 p 值。备择分布下虚线左侧为Ⅱ类错误,右侧为检验效能。红色条表示效应量为两分布峰值之差。

分析前

获取效应量:

  • 背景信息
  • 预试数据

 

分析后

获取效应量:

  • 全部数据集
R 中的 A/B 测试

检验的效能分析

更高效能 = 更高概率正确拒绝原假设

需要三要素:

  • 样本量
  • 效应量
  • 显著性水平(Alpha)
library(pwr)
pwr.t.test(n = 20, sig.level = 0.045, 
           d = .81, type = "one.sample")
     One-sample t test power calculation 
              n = 20
              d = 0.81
      sig.level = 0.045
          power = 0.9223189
    alternative = two.sided
R 中的 A/B 测试

披萨分布

分布相似

无显著差异

两个直方图,粉色为意大利辣香肠,蓝色为芝士。x 轴为每次收到的取值,y 轴为出现次数,两者峰值在 x 轴上相近。

分布不同

可能有显著差异

两个直方图,粉色为意大利辣香肠,蓝色为芝士。x 轴为每次收到的取值,y 轴为出现次数,两者峰值在 x 轴上分离。

R 中的 A/B 测试

披萨假设

粉色为原假设分布,均值差为 0;蓝色为备择假设分布,均值差为 3.5;竖线 1.64 为临界拒绝值。

  • 相似:在拒绝值左侧
  • 不同:在拒绝值右侧
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
R 中的 A/B 测试

披萨的效能

粉色为原假设分布,均值差为 0;蓝色为备择假设分布,均值差为 3.5;竖线 1.64 为临界拒绝值。

  • 相似:在拒绝值左侧
  • 不同:在拒绝值右侧
  • 效能:不错误地判为相同配料分布的概率(Ⅱ类错误)
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
R 中的 A/B 测试

开始练习吧!

R 中的 A/B 测试

Preparing Video For Download...