पावर और सैंपल साइज

R में A/B Testing

Lauryn Burleigh

Data Scientist

पावर की परिभाषा

  • जब शून्य परिकल्पना गलत हो तो उसे खारिज करने की प्रायिकता
  • शून्य को न खारिज करने वाली टाइप II त्रुटि न करना
  • आदर्श: टाइप II त्रुटि कम, पावर अधिक

बाएँ शून्य परिकल्पना का सामान्य वितरण और दाएँ वैकल्पिक परिकल्पना का वितरण, आंशिक ओवरलैप के साथ। एक डैश्ड क्षैतिज रेखा वह p-value दिखाती है जहाँ वितरण ओवरलैप करते हैं। वैकल्पिक परिकल्पना के तहत रेखा के बाएँ भाग में टाइप II त्रुटि और दाएँ भाग में पावर दर्शाई गई है.

R में A/B Testing

पावर के फायदे

टेस्ट की उपयोगिता

  • जब ज़रूरी हो, शून्य परिकल्पना को खारिज करना

बाएँ शून्य परिकल्पना का सामान्य वितरण और दाएँ वैकल्पिक परिकल्पना का वितरण, आंशिक ओवरलैप के साथ। एक डैश्ड क्षैतिज रेखा वह p-value दिखाती है जहाँ वितरण ओवरलैप करते हैं। वैकल्पिक परिकल्पना के तहत रेखा के बाएँ भाग में टाइप II त्रुटि और दाएँ भाग में पावर दर्शाई गई है.

पावर

  • ज़रूरी सैंपल साइज तय करें
  • जाँचें कि नतीजे भरोसेमंद हैं या नहीं
R में A/B Testing

सैंपल साइज

  • अनुमानित इफ़ेक्ट साइज
  • अनुमानित पावर (आम तौर पर 0.8)
  • अल्फा (आम तौर पर 0.05)

विभिन्न सैंपल साइज के ओवरलैपिंग वितरण जहाँ छोटे सैंपल साइज का t-value वितरण बड़ा सैंपल साइज से संकरा है; छोटा सैंपल साइज महत्व तक पहुँचने के लिए बड़े t-value की जरूरत दिखाता है.

library(pwr)
pwr.t.test(d = .8, power = 0.8,

sig.level = 0.05,
type = "one.sample",
alternative = "two.sided")
     One-sample t test power calculation 
              n = 14.30276
              d = 0.8
      sig.level = 0.05
          power = 0.8
    alternative = two.sided
R में A/B Testing

इफ़ेक्ट साइज

  • अपेक्षित प्रभाव का आकार
  • कंट्रोल समूह का औसत - प्रयोगात्मक समूह का औसत

बाएँ शून्य परिकल्पना का सामान्य वितरण और दाएँ वैकल्पिक परिकल्पना का वितरण, आंशिक ओवरलैप के साथ। एक डैश्ड क्षैतिज रेखा वह p-value दिखाती है जहाँ वितरण ओवरलैप करते हैं। दोनों वितरणों की चोटी के अंतर को लाल बार से इफ़ेक्ट साइज दिखाया गया है.

विश्लेषण से पहले

इफ़ेक्ट साइज पाएँ:

  • पृष्ठभूमि जानकारी
  • प्रारंभिक डेटा

 

विश्लेषण के बाद

इफ़ेक्ट साइज पाएँ:

  • पूरा डेटा सेट
R में A/B Testing

टेस्ट की पावर विश्लेषण

उच्च पावर = शून्य परिकल्पना को सही तरह खारिज करने की अधिक प्रायिकता

तीन ज़रूरी पहलू:

  • सैंपल साइज
  • इफ़ेक्ट साइज
  • अल्फा
library(pwr)
pwr.t.test(n = 20, sig.level = 0.045, 
           d = .81, type = "one.sample")
     One-sample t test power calculation 
              n = 20
              d = 0.81
      sig.level = 0.045
          power = 0.9223189
    alternative = two.sided
R में A/B Testing

पिज़्ज़ा वितरण

समान वितरण

कोई महत्वपूर्ण अंतर नहीं

दो हिस्टोग्राम: पेपरोनी गुलाबी और चीज़ नीला। x-अक्ष पर प्राप्त मान और y-अक्ष पर आवृत्ति, दोनों के पीक x-अक्ष पर क़रीब हैं.

भिन्न वितरण

महत्वपूर्ण अंतर होने की संभावना

दो हिस्टोग्राम: पेपरोनी गुलाबी और चीज़ नीला। x-अक्ष पर प्राप्त मान और y-अक्ष पर आवृत्ति, दोनों के पीक x-अक्ष पर दूर-दूर हैं.

R में A/B Testing

पिज़्ज़ा परिकल्पनाएँ

शून्य परिकल्पना का गुलाबी वितरण, औसत अंतर 0; वैकल्पिक परिकल्पना का नीला वितरण, औसत अंतर 3.5; 1.64 पर वर्टिकल लाइन क्रिटिकल रिजेक्शन वैल्यू दिखाती है.

  • समान: रिजेक्शन वैल्यू के बाएँ
  • भिन्न: रिजेक्शन वैल्यू के दाएँ
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
R में A/B Testing

पिज़्ज़ा पावर

शून्य परिकल्पना का गुलाबी वितरण, औसत अंतर 0; वैकल्पिक परिकल्पना का नीला वितरण, औसत अंतर 3.5; 1.64 पर वर्टिकल लाइन क्रिटिकल रिजेक्शन वैल्यू दिखाती है.

  • समान: रिजेक्शन वैल्यू के बाएँ
  • भिन्न: रिजेक्शन वैल्यू के दाएँ
  • पावर: समान टॉपिंग वितरण "गलती से" न पाने की प्रायिकता (टाइप II त्रुटि)
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
R में A/B Testing

अभ्यास करते हैं!

R में A/B Testing

Preparing Video For Download...