p-values

R में Hypothesis Testing

Richie Cotton

Data Evangelist at DataCamp

आपराधिक मुकदमे

  • दो संभावित सत्य स्थितियाँ.
    1. अभियुक्त ने अपराध किया.
    2. अभियुक्त ने अपराध नहीं किया.
  • दो संभावित फ़ैसले.
    1. दोषी.
    2. निर्दोष.
  • शुरुआत में अभियुक्त को निर्दोष माना जाता है.
  • यदि सबूत "संदेह से परे" हो कि अभियुक्त ने अपराध किया, तो "दोषी" का फ़ैसला दें, वरना "निर्दोष".
R में Hypothesis Testing

पहली बार प्रोग्रामिंग की उम्र

  • age_first_code_cut बताता है कि Stack Overflow यूज़र ने पहली बार प्रोग्रामिंग कब शुरू की
    1. "adult" मतलब 14 या उससे अधिक उम्र में शुरू किया
    2. "child" मतलब 14 से पहले शुरू किया
  • पहले के शोध बताते हैं कि 35% सॉफ़्टवेयर डेवलपर्स ने बचपन में प्रोग्रामिंग शुरू की थी
  • क्या हमारा सैंपल दिखाता है कि डेटा साइंटिस्ट्स में बचपन में शुरू करने का अनुपात ज़्यादा है?
R में Hypothesis Testing

परिभाषाएँ

एक hypothesis किसी अज्ञात जनसंख्या पैरामीटर के बारे में कथन है.

hypothesis test दो प्रतिस्पर्धी हाइपोथीसिस का परीक्षण है.

  • null hypothesis ($H_{0}$) मौजूदा "चैंपियन" विचार है.

  • alternative hypothesis ($H_{A}$) शोधकर्ता का नया "चैलेंजर" विचार है.

हमारी समस्या के लिए

  • $H_{0}$: बचपन में प्रोग्रामिंग शुरू करने वाले डेटा साइंटिस्ट्स का अनुपात सॉफ़्टवेयर डेवलपर्स (35%) के समान है.
  • $H_{A}$: बचपन में प्रोग्रामिंग शुरू करने वाले डेटा साइंटिस्ट्स का अनुपात 35% से अधिक है.
1 "Naught" ब्रिटिश अंग्रेज़ी में "zero" के लिए है. ऐतिहासिक कारणों से, null hypothesis का उच्चारण करने के लिए "H-naught" अंतरराष्ट्रीय प्रचलन है.
R में Hypothesis Testing
  • दो संभावित सत्य स्थितियाँ.
    1. अभियुक्त ने अपराध किया.
    2. अभियुक्त ने अपराध नहीं किया.
  • दो संभावित फ़ैसले.
    1. दोषी.
    2. निर्दोष.
  • शुरुआत में अभियुक्त को निर्दोष माना जाता है.
  • यदि सबूत "संदेह से परे" हो कि अभियुक्त ने अपराध किया, तो "दोषी" का फ़ैसला दें, वरना "निर्दोष".
  • वास्तविकता में या तो $H_{A}$ सही है या $H_{0}$ (दोनों नहीं).
  • परीक्षण का निष्कर्ष या तो "$H_{0}$ को अस्वीकार करें" या "$H_{0}$ को अस्वीकार करने में असफल" होता है.
  • शुरुआत में null hypothesis, $H_{0}$, को सही माना जाता है.
  • यदि सैंपल से मिला सबूत "significant" हो कि $H_{A}$ सही है, तो वही चुनें, वरना $H_{0}$ चुनें.

Significance level हाइपोथीसिस टेस्टिंग के लिए "संदेह से परे" की दहलीज है.

R में Hypothesis Testing

वन-टेल्ड और टू-टेल्ड टेस्ट

स्टैंडर्ड नॉर्मल डिस्ट्रीब्यूशन के pdf का डेंसिटी प्लॉट, बीच का भाग ढका है, सिर्फ टेल्स दिख रही हैं.

Hypothesis tests जाँचते हैं कि sample statistics null distribution की टेल्स में हैं या नहीं.

टेस्ट टेल्स
alternative null से अलग two-tailed
alternative null से बड़ा right-tailed
alternative null से छोटा left-tailed

$H_{A}$: बचपन में प्रोग्रामिंग शुरू करने वाले डेटा साइंटिस्ट्स का अनुपात 35% से अधिक है.

हमारा alternative "greater than" है, इसलिए हमें right-tailed टेस्ट चाहिए.

R में Hypothesis Testing

p-values

  • p-value जितनी बड़ी, $H_{0}$ के पक्ष में समर्थन उतना मजबूत.
  • p-value जितनी छोटी, $H_{0}$ के खिलाफ सबूत उतना मजबूत.
  • छोटी p-values का मतलब है कि स्टैटिस्टिक null distribution की टेल में है (वह डिस्ट्रीब्यूशन जो null hypothesis सही होने पर होता).
    • p-value में "p" का अर्थ probability है.
    • p-values के लिए "छोटी" का मतलब "शून्य के क़रीब".
R में Hypothesis Testing

p-value की परिभाषा

एक p-value है

किसी test statistic को देखने की probability

उतनी ही चरम या उससे अधिक चरम

जितनी हमारे मूल सैंपल में देखी गई,

मानते हुए कि null hypothesis सही है.

R में Hypothesis Testing

z-score की गणना

prop_child_samp <- stack_overflow %>%
  summarize(point_estimate = mean(age_first_code_cut == "child")) %>%
  pull(point_estimate)
0.388
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
3.956
R में Hypothesis Testing

p-value की गणना

  • pnorm() normal CDF है.
  • Left-tailed test → डिफ़ॉल्ट lower.tail = TRUE रखें.
  • Right-tailed test → lower.tail = FALSE सेट करें.

 

p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
R में Hypothesis Testing

अभ्यास करते हैं!

R में Hypothesis Testing

Preparing Video For Download...