Central limit theorem

Python में Statistics परिचय

Maggie Matsui

Content Developer, DataCamp

पासा 5 बार फेंकना

die = pd.Series([1, 2, 3, 4, 5, 6])

# Roll 5 times samp_5 = die.sample(5, replace=True) print(samp_5)
array([3, 1, 4, 1, 1])
np.mean(samp_5)
2.0

 

छह पहलू वाला पासा

Python में Statistics परिचय

पासा 5 बार फेंकना

# Roll 5 times and take mean
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
4.4
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
3.8
Python में Statistics परिचय

पासा 5 बार, यह प्रक्रिया 10 बार

10 बार दोहराएँ:

  • 5 बार फेंकें
  • औसत लें
sample_means = []

for i in range(10):
samp_5 = die.sample(5, replace=True) sample_means.append(np.mean(samp_5))
print(sample_means)
[3.8, 4.0, 3.8, 3.6, 3.2, 4.8, 2.6,
3.0, 2.6, 2.0]
Python में Statistics परिचय

सैंपलिंग डिस्ट्रीब्यूशन

सैंपल औसत का सैंपलिंग डिस्ट्रीब्यूशन

10 सैंपल औसतों का हिस्टोग्राम

Python में Statistics परिचय

100 सैंपल औसत

sample_means = []
for i in range(100):
    sample_means.append(np.mean(die.sample(5, replace=True)))

100 सैंपल औसतों का हिस्टोग्राम

Python में Statistics परिचय

1000 सैंपल औसत

sample_means = []
for i in range(1000):
    sample_means.append(np.mean(die.sample(5, replace=True)))

1000 सैंपल औसतों का हिस्टोग्राम

Python में Statistics परिचय

Central limit theorem

किसी सांख्यिकीय मान का सैंपलिंग डिस्ट्रीब्यूशन, ट्रायल्स की संख्या बढ़ने पर नॉर्मल डिस्ट्रीब्यूशन के और करीब हो जाता है।

10, 100, और 1000 सैंपल औसतों के हिस्टोग्राम, जहाँ ज्यादा संख्या पर डिस्ट्रीब्यूशन घंटी-आकृति जैसा दिखता है

 

* सैंपल रैंडम और स्वतंत्र होने चाहिए

Python में Statistics परिचय

Standard deviation और CLT

sample_sds = []
for i in range(1000):
  sample_sds.append(np.std(die.sample(5, replace=True)))

5 पासा फेंकों के 1000 सैंपल standard deviation का डिस्ट्रीब्यूशन

Python में Statistics परिचय

Proportion और CLT

sales_team = pd.Series(["Amir", "Brian", "Claire", "Damian"])

sales_team.sample(10, replace=True)
array(['Claire', 'Damian', 'Brian', 'Damian', 'Damian', 'Amir', 'Amir', 'Amir', 
      'Amir', 'Damian'], dtype=object)
sales_team.sample(10, replace=True)
array(['Brian', 'Amir', 'Brian', 'Claire', 'Brian', 'Damian', 'Claire', 'Brian', 
      'Claire', 'Claire'], dtype=object)
Python में Statistics परिचय

Proportion का सैंपलिंग डिस्ट्रीब्यूशन

सैंपल proportion का डिस्ट्रीब्यूशन भी नॉर्मल जैसा दिखता है

Python में Statistics परिचय

सैंपलिंग डिस्ट्रीब्यूशन का औसत

# Estimate expected value of die
np.mean(sample_means)
3.48
# Estimate proportion of "Claire"s
np.mean(sample_props)
0.26

बीच में डैश्ड लाइन वाला सैंपल औसतों का सैंपलिंग डिस्ट्रीब्यूशन  

  • अज्ञात आधारभूत डिस्ट्रीब्यूशन की विशेषताएँ आँकें
  • बड़े पॉपुलेशन की विशेषताएँ अधिक आसानी से आँकें
Python में Statistics परिचय

अभ्यास करते हैं!

Python में Statistics परिचय

Preparing Video For Download...