अनुमान का शॉर्टकट

R में श्रेणीबद्ध डेटा के लिए अनुमान

Andrew Bray

Assistant Professor of Statistics at Reed College

कॉन्फिडेंस इंटरवल

SE
0.009998905
SE_small_n
0.03809731
SE_low_p
0.00547912

स्टैंडर्ड एरर बढ़ता है जब

  • n छोटा हो
  • p 0.5 के करीब हो
R में श्रेणीबद्ध डेटा के लिए अनुमान

bootstrap_one.png

R में श्रेणीबद्ध डेटा के लिए अनुमान

bootstrap_two.png

R में श्रेणीबद्ध डेटा के लिए अनुमान

नॉर्मल डिस्ट्रीब्यूशन

इसे "bell curve" भी कहते हैं.

यदि

  • observations स्वतंत्र हों
  • n बड़ा हो

तो

  • $\hat{p}$ normal distribution का पालन करता है

ch1v3-normal-curve.png

R में श्रेणीबद्ध डेटा के लिए अनुमान

स्टैंडर्ड डिविएशन

$$\sqrt{\frac{ \hat{p} \times (1 - \hat{p})}{n}}$$

R में श्रेणीबद्ध डेटा के लिए अनुमान

मॉडल की धारणाएँ जाँचना

मैं कैसे जाँचूँ कि "observations स्वतंत्र हैं"?

  • यह डेटा संग्रह विधि पर निर्भर करता है.

"n बड़ा है" का क्या मतलब?

  • $n \times \hat{p} \gt 10$
  • $n \times(1 - \hat{p}) \gt 10$
R में श्रेणीबद्ध डेटा के लिए अनुमान

स्टैंडर्ड एरर निकालना: approximation

p_hat <- gss2016 %>%
  summarize(mean(happy == "HAPPY")) %>%
  pull()
n <- nrow(gss2016)
c(n * p_hat, n * (1 - p_hat))
116  35
SE_approx <- sqrt(p_hat * (1 - p_hat) / n)
SE_approx
0.03418468
R में श्रेणीबद्ध डेटा के लिए अनुमान

स्टैंडर्ड एरर निकालना: computation

boot <- gss2016 %>%
  specify(response = happy, success = "HAPPY") %>%
  generate(reps = 500, type = "bootstrap") %>%
  calculate(stat = "prop")
SE_boot <- boot %>%
  summarize(sd(stat)) %>%
  pull()
SE_boot
0.03176741
R में श्रेणीबद्ध डेटा के लिए अनुमान

सैंपलिंग डिस्ट्रीब्यूशन

ggplot(boot, aes(x = stat)) +
  geom_density()

ch1v3-density-curve-1.png

R में श्रेणीबद्ध डेटा के लिए अनुमान

सैंपलिंग डिस्ट्रीब्यूशन

ggplot(boot, aes(x = stat)) +
  geom_density() +
  stat_function(fun = dnorm, 
                color = "purple",
                args = 
                  list(mean = p_hat,
                       sd = SE_approx))

ch1v3-density-curve-1.png

R में श्रेणीबद्ध डेटा के लिए अनुमान

सैंपलिंग डिस्ट्रीब्यूशन

ggplot(boot, aes(x = stat)) +
  geom_density() +
  stat_function(fun = dnorm, 
                color = "purple",
                args = 
                  list(mean = p_hat,
                       sd = SE_approx))

ch1v3-density-curve-2.png

R में श्रेणीबद्ध डेटा के लिए अनुमान

अभ्यास करते हैं!

R में श्रेणीबद्ध डेटा के लिए अनुमान

Preparing Video For Download...