อำนาจทดสอบและขนาดตัวอย่าง

A/B Testing ใน R

Lauryn Burleigh

Data Scientist

นิยามอำนาจทดสอบ

  • ความน่าจะเป็นที่จะปฏิเสธสมมติฐานหลักเมื่อสมมติฐานหลักเป็นเท็จ
  • ไม่เกิดข้อผิดพลาด Type II (ไม่ปฏิเสธสมมติฐานหลักทั้งที่ควรปฏิเสธ)
  • อุดมคติ: ข้อผิดพลาด Type II น้อย อำนาจทดสอบสูง

การแจกแจงปกติของสมมติฐานหลักทางซ้ายและสมมติฐานทางเลือกทางขวา ซ้อนทับกันบางส่วน เส้นประแนวนอนแสดง p-value ตรงจุดที่การแจกแจงทั้งสองทับกัน พื้นที่ซ้ายของเส้นใต้การแจกแจงสมมติฐานทางเลือกคือข้อผิดพลาด Type II และพื้นที่ขวาของเส้นคืออำนาจทดสอบ

A/B Testing ใน R

ประโยชน์ของอำนาจทดสอบ

ประโยชน์ของการทดสอบ

  • ปฏิเสธสมมติฐานหลักเมื่อควรปฏิเสธ

การแจกแจงปกติของสมมติฐานหลักทางซ้ายและสมมติฐานทางเลือกทางขวา ซ้อนทับกันบางส่วน เส้นประแนวนอนแสดง p-value ตรงจุดที่การแจกแจงทั้งสองทับกัน พื้นที่ซ้ายของเส้นใต้การแจกแจงสมมติฐานทางเลือกคือข้อผิดพลาด Type II และพื้นที่ขวาของเส้นคืออำนาจทดสอบ

อำนาจทดสอบ

  • กำหนดขนาดตัวอย่างที่ต้องการ
  • ตรวจสอบความน่าเชื่อถือของผลลัพธ์
A/B Testing ใน R

ขนาดตัวอย่าง

  • ขนาดเอฟเฟกต์ที่ประเมิน
  • อำนาจทดสอบที่ประเมิน (ทั่วไปคือ 0.8)
  • Alpha (ทั่วไปคือ 0.05)

การแจกแจงที่ทับซ้อนกันของขนาดตัวอย่างต่างๆ ขนาดตัวอย่างเล็กมีการแจกแจงแคบกว่าขนาดใหญ่ โดยพล็อต t-value บนแกน x เส้นขนาดตัวอย่างเล็กแสดงว่าต้องการ t-value สูงกว่าจึงจะมีนัยสำคัญ

library(pwr)
pwr.t.test(d = .8, power = 0.8,

sig.level = 0.05,
type = "one.sample",
alternative = "two.sided")
     One-sample t test power calculation 
              n = 14.30276
              d = 0.8
      sig.level = 0.05
          power = 0.8
    alternative = two.sided
A/B Testing ใน R

ขนาดเอฟเฟกต์

  • ขนาดเอฟเฟกต์ที่คาดหวัง
  • ค่าเฉลี่ยกลุ่มควบคุม ลบ ค่าเฉลี่ยกลุ่มทดลอง

การแจกแจงปกติของสมมติฐานหลักทางซ้ายและสมมติฐานทางเลือกทางขวา ซ้อนทับกันบางส่วน เส้นประแนวนอนแสดง p-value ตรงจุดที่การแจกแจงทั้งสองทับกัน พื้นที่ซ้ายของเส้นใต้การแจกแจงสมมติฐานทางเลือกคือข้อผิดพลาด Type II และพื้นที่ขวาคืออำนาจทดสอบ แถบสีแดงแสดงว่าขนาดเอฟเฟกต์คือความแตกต่างระหว่างยอดของการแจกแจงทั้งสอง

ก่อนวิเคราะห์

หาขนาดเอฟเฟกต์จาก:

  • ข้อมูลพื้นฐาน
  • ข้อมูลเบื้องต้น

 

หลังวิเคราะห์

หาขนาดเอฟเฟกต์จาก:

  • ชุดข้อมูลทั้งหมด
A/B Testing ใน R

การวิเคราะห์อำนาจทดสอบ

อำนาจทดสอบสูง = ความน่าจะเป็นสูงที่จะปฏิเสธสมมติฐานหลักได้อย่างถูกต้อง

สามองค์ประกอบที่จำเป็น:

  • ขนาดตัวอย่าง
  • ขนาดเอฟเฟกต์
  • Alpha
library(pwr)
pwr.t.test(n = 20, sig.level = 0.045, 
           d = .81, type = "one.sample")
     One-sample t test power calculation 
              n = 20
              d = 0.81
      sig.level = 0.045
          power = 0.9223189
    alternative = two.sided
A/B Testing ใน R

การแจกแจงของพิซซ่า

การแจกแจงคล้ายกัน

ไม่มีความแตกต่างอย่างมีนัยสำคัญ

ฮิสโตแกรมสองชุด Pepperoni สีชมพูและ Cheese สีน้ำเงิน พล็อตค่าที่ได้รับบนแกน x และจำนวนครั้งที่ค่านั้นปรากฏบนแกน y โดยยอดของทั้งสองอยู่ใกล้กันบนแกน x

การแจกแจงต่างกัน

น่าจะมีความแตกต่างอย่างมีนัยสำคัญ

ฮิสโตแกรมสองชุด Pepperoni สีชมพูและ Cheese สีน้ำเงิน พล็อตค่าที่ได้รับบนแกน x และจำนวนครั้งที่ค่านั้นปรากฏบนแกน y โดยยอดของทั้งสองแยกออกจากกันบนแกน x

A/B Testing ใน R

สมมติฐานพิซซ่า

การแจกแจงสมมติฐานหลักสีชมพูที่ค่าเฉลี่ยต่าง = 0 และการแจกแจงสมมติฐานทางเลือกสีน้ำเงินที่ค่าเฉลี่ยต่าง = 3.5 โดยมีเส้นแนวตั้งที่ 1.64 แสดงค่าวิกฤตสำหรับการปฏิเสธ

  • คล้ายกัน: ซ้ายของค่าวิกฤต
  • ต่างกัน: ขวาของค่าวิกฤต
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
A/B Testing ใน R

อำนาจทดสอบของพิซซ่า

การแจกแจงสมมติฐานหลักสีชมพูที่ค่าเฉลี่ยต่าง = 0 และการแจกแจงสมมติฐานทางเลือกสีน้ำเงินที่ค่าเฉลี่ยต่าง = 3.5 โดยมีเส้นแนวตั้งที่ 1.64 แสดงค่าวิกฤตสำหรับการปฏิเสธ

  • คล้ายกัน: ซ้ายของค่าวิกฤต
  • ต่างกัน: ขวาของค่าวิกฤต
  • อำนาจทดสอบ: ความน่าจะเป็นที่จะไม่สรุปผิดว่าท็อปปิ้งมีการแจกแจงเหมือนกัน (ข้อผิดพลาด Type II)
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
A/B Testing ใน R

มาฝึกกันเถอะ!

A/B Testing ใน R

Preparing Video For Download...