सिमुलेशन के जरिए दो माध्यों की तुलना के लिए हाइपोथेसिस टेस्टिंग

R में संख्यात्मक डेटा के लिए Inference

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

प्रेरणा

  • प्रेरक प्रश्न: क्या embryonic stem cells से उपचार, हृदयाघात के बाद, पारंपरिक थेरेपी से अधिक हृदय क्रिया में सुधार करता है?

  • डेटा: openintro पैकेज का stem.cell डेटा

library(openintro)
data(stem.cell)
   trmt   before   after 
1  ctrl    35.25   29.50
2  ctrl    36.50   29.50
3  ctrl    39.75   36.25
   ...      ...     ... 
n  esc     53.75   51.00
R में संख्यात्मक डेटा के लिए Inference

विश्लेषण रूपरेखा

स्टेप 1. हर भेड़ के लिए change निकालें: उस भेड़ के before और after पंपिंग क्षमता का अंतर।

   trmt   before   after   change 
1  ctrl    35.25   29.50   ?
2  ctrl    36.50   29.50   ?
3  ctrl    39.75   36.25   ?
   ...      ...     ...   
n  esc     53.75   51.00   ?
R में संख्यात्मक डेटा के लिए Inference

विश्लेषण रूपरेखा

स्टेप 2. हाइपोथेसिस सेट करें:

$H_0: \mu_{esc} = \mu_{ctrl}$; ट्रीटमेंट और कंट्रोल में औसत परिवर्तन में कोई अंतर नहीं है।

$H_A: \mu_{esc} > \mu_{ctrl}$; ट्रीटमेंट और कंट्रोल में औसत परिवर्तन में अंतर है।

R में संख्यात्मक डेटा के लिए Inference

विश्लेषण रूपरेखा

स्टेप 3. हाइपोथेसिस टेस्ट करें।

  • change के मान 18 इंडेक्स कार्ड्स पर लिखें।
  • (1) कार्ड्स को शफल करें और यादृच्छिक रूप से दो बराबर डेक्स में बाँटें: ट्रीटमेंट और कंट्रोल।
  • (2) टेस्ट स्टैटिस्टिक निकालें और रिकॉर्ड करें: ट्रीटमेंट और कंट्रोल के औसत change का अंतर।
  • सैंपलिंग डिस्ट्रीब्यूशन बनाने के लिए (1) और (2) कई बार दोहराएँ।
  • p-value निकालें: जितनी सिमुलेशंस में टेस्ट स्टैटिस्टिक, सैंपल माध्यों के देखे गए अंतर जितना या उससे अधिक चरम है, उनका प्रतिशत।
R में संख्यात्मक डेटा के लिए Inference

Hypothesis test: resamples जनरेट करें

infer पैकेज से टेस्ट करें:

library(infer)
R में संख्यात्मक डेटा के लिए Inference

Hypothesis test: resamples जनरेट करें

डेटा फ्रेम से शुरू करें और मॉडल specify करें:

library(infer)

diff_ht_mean <- stem.cell %>%
  specify(__) %>%                    # y ~ x
  ...
R में संख्यात्मक डेटा के लिए Inference

Hypothesis test: resamples जनरेट करें

शून्य हाइपोथेसिस घोषित करें, यानी माध्यों में कोई अंतर नहीं:

library(infer)

diff_ht_mean <- stem.cell %>%
  specify(__) %>%                    # y ~ x
  hypothesize(null = __) %>%         # "independence" or "point"
  ...
R में संख्यात्मक डेटा के लिए Inference

Hypothesis test: resamples जनरेट करें

$H_0$ सही मानते हुए resamples जनरेट करें:

library(infer)

diff_ht_mean <- stem.cell %>%
  specify(__) %>%                    # y ~ x
  hypothesize(null = __) %>%         # "independence" or "point"
  generate(reps = __, type = __) %>% # "bootstrap", "permute", or "simulate"
  ...
R में संख्यात्मक डेटा के लिए Inference

Hypothesis test: resamples जनरेट करें

टेस्ट स्टैटिस्टिक कैलकुलेट करें:

library(infer)

diff_ht_mean <- stem.cell %>%
  specify(__) %>%                    # y ~ x
  hypothesize(null = __) %>%         # "independence" or "point"
  generate(reps = _N_, type = __) %>%# "bootstrap", "permute", or "simulate"
  calculate(stat = "diff in means")  # type of statistic to calculate
R में संख्यात्मक डेटा के लिए Inference

Hypothesis test: p-value कैलकुलेट करें

p-value निकालें: जितनी सिमुलेशंस में सैंपल माध्यों के बीच सिमुलेटेड अंतर, देखे गए अंतर जितना या उससे अधिक चरम है, उनका अनुपात

$$P ((\bar{x}_{esc,sim} - \bar{x}_{ctrl,sim}) \ge (\bar{x}_{esc,obs} - \bar{x}_{ctrl,obs}))$$

R में संख्यात्मक डेटा के लिए Inference

अभ्यास करते हैं!

R में संख्यात्मक डेटा के लिए Inference

Preparing Video For Download...