सैंपलिंग बनाम बूटस्ट्रैप डिस्ट्रीब्यूशन की तुलना

Python में Sampling

James Chapman

Curriculum Manager, DataCamp

कॉफी-केन्द्रित सबसेट

coffee_sample = coffee_ratings[["variety", "country_of_origin", "flavor"]]\
    .reset_index().sample(n=500)
     index         variety       country_of_origin  flavor
132    132           Other              Costa Rica    7.58
51      51            None  United States (Hawaii)    8.17
42      42  Yellow Bourbon                  Brazil    7.92
569    569         Bourbon               Guatemala    7.67
..     ...             ...                     ...     ...
643    643          Catuai              Costa Rica    7.42
356    356         Caturra                Colombia    7.58
494    494            None               Indonesia    7.58
169    169            None                  Brazil    7.81

[500 rows x 4 columns]
Python में Sampling

मीन कॉफी फ्लेवर का बूटस्ट्रैप

import numpy as np
mean_flavors_5000 = []
for i in range(5000):
    mean_flavors_5000.append(
        np.mean(coffee_sample.sample(frac=1, replace=True)['flavor'])
    )
bootstrap_distn = mean_flavors_5000
Python में Sampling

मीन फ्लेवर का बूटस्ट्रैप डिस्ट्रीब्यूशन

import matplotlib.pyplot as plt
plt.hist(bootstrap_distn, bins=15)
plt.show()

बूटस्ट्रैप डिस्ट्रीब्यूशन का एक हिस्टोग्राम.

Python में Sampling

सैंपल, बूटस्ट्रैप डिस्ट्रीब्यूशन, पॉपुलेशन मीन

सैंपल मीन:

coffee_sample['flavor'].mean()
7.5132200000000005

अनुमानित पॉपुलेशन मीन:

np.mean(bootstrap_distn)
7.513357731999999

वास्तविक पॉपुलेशन मीन:

coffee_ratings['flavor'].mean()
7.526046337817639
Python में Sampling

मीन की व्याख्या

बूटस्ट्रैप डिस्ट्रीब्यूशन का मीन:

  • आमतौर पर सैंपल मीन के क़रीब होता है
  • पॉपुलेशन मीन का अच्छा अनुमान नहीं भी हो सकता

  बूटस्ट्रैपिंग सैंपलिंग से आए बायस को ठीक नहीं कर सकता

Python में Sampling

सैंपल sd बनाम बूटस्ट्रैप डिस्ट्रीब्यूशन sd

सैंपल स्टैंडर्ड डिविएशन:

coffee_sample['flavor'].std()
0.3540883911928703

अनुमानित पॉपुलेशन स्टैंडर्ड डिविएशन?

np.std(bootstrap_distn, ddof=1)
0.015768474367958217
Python में Sampling

सैंपल, बूटस्ट्रैप डिस्ट्रि., पॉप. स्टैंडर्ड डिविएशन

सैंपल स्टैंडर्ड डिविएशन:

coffee_sample['flavor'].std()
0.3540883911928703

अनुमानित पॉपुलेशन स्टैंडर्ड डिविएशन:

standard_error = np.std(bootstrap_distn, ddof=1)

स्टैंडर्ड एरर उस सांख्यिकीय मान का स्टैंडर्ड डिविएशन है जिसमें रुचि है

वास्तविक स्टैंडर्ड डिविएशन:

coffee_ratings['flavor'].std(ddof=0)
0.34125481224622645
standard_error * np.sqrt(500)
0.3525938058821761

स्टैंडर्ड एरर × सैंपल साइज का वर्गमूल ≈ पॉपुलेशन स्टैंडर्ड डिविएशन का अनुमान

Python में Sampling

स्टैंडर्ड एरर की व्याख्या

  • अनुमानित स्टैंडर्ड एरर → किसी सैंपल स्टैटिस्टिक के लिए बूटस्ट्रैप डिस्ट्रीब्यूशन का स्टैंडर्ड डिविएशन
  • $\text{Population std. dev} \approx \text{Std. Error} \times \sqrt{\text{Sample size}}$
Python में Sampling

अभ्यास करते हैं!

Python में Sampling

Preparing Video For Download...