R में संख्यात्मक डेटा के लिए Inference
Mine Cetinkaya-Rundel
Associate Professor of the Practice, Duke University
प्रेरक प्रश्न: क्या embryonic stem cells से उपचार, हृदयाघात के बाद, पारंपरिक थेरेपी से अधिक हृदय क्रिया में सुधार करता है?
डेटा: openintro पैकेज का stem.cell डेटा
library(openintro)
data(stem.cell)
trmt before after
1 ctrl 35.25 29.50
2 ctrl 36.50 29.50
3 ctrl 39.75 36.25
... ... ...
n esc 53.75 51.00
स्टेप 1. हर भेड़ के लिए change निकालें: उस भेड़ के before और after पंपिंग क्षमता का अंतर।
trmt before after change
1 ctrl 35.25 29.50 ?
2 ctrl 36.50 29.50 ?
3 ctrl 39.75 36.25 ?
... ... ...
n esc 53.75 51.00 ?
स्टेप 2. हाइपोथेसिस सेट करें:
$H_0: \mu_{esc} = \mu_{ctrl}$; ट्रीटमेंट और कंट्रोल में औसत परिवर्तन में कोई अंतर नहीं है।
$H_A: \mu_{esc} > \mu_{ctrl}$; ट्रीटमेंट और कंट्रोल में औसत परिवर्तन में अंतर है।
स्टेप 3. हाइपोथेसिस टेस्ट करें।
change के मान 18 इंडेक्स कार्ड्स पर लिखें।change का अंतर।infer पैकेज से टेस्ट करें:
library(infer)
डेटा फ्रेम से शुरू करें और मॉडल specify करें:
library(infer)
diff_ht_mean <- stem.cell %>%
specify(__) %>% # y ~ x
...
शून्य हाइपोथेसिस घोषित करें, यानी माध्यों में कोई अंतर नहीं:
library(infer)
diff_ht_mean <- stem.cell %>%
specify(__) %>% # y ~ x
hypothesize(null = __) %>% # "independence" or "point"
...
$H_0$ सही मानते हुए resamples जनरेट करें:
library(infer)
diff_ht_mean <- stem.cell %>%
specify(__) %>% # y ~ x
hypothesize(null = __) %>% # "independence" or "point"
generate(reps = __, type = __) %>% # "bootstrap", "permute", or "simulate"
...
टेस्ट स्टैटिस्टिक कैलकुलेट करें:
library(infer)
diff_ht_mean <- stem.cell %>%
specify(__) %>% # y ~ x
hypothesize(null = __) %>% # "independence" or "point"
generate(reps = _N_, type = __) %>%# "bootstrap", "permute", or "simulate"
calculate(stat = "diff in means") # type of statistic to calculate
p-value निकालें: जितनी सिमुलेशंस में सैंपल माध्यों के बीच सिमुलेटेड अंतर, देखे गए अंतर जितना या उससे अधिक चरम है, उनका अनुपात
$$P ((\bar{x}_{esc,sim} - \bar{x}_{ctrl,sim}) \ge (\bar{x}_{esc,obs} - \bar{x}_{ctrl,obs}))$$
R में संख्यात्मक डेटा के लिए Inference