सैंपलिंग और प्वाइंट एस्टिमेट्स

Python में Sampling

James Chapman

Curriculum Manager, DataCamp

फ़्रांस की आबादी का अनुमान

फ़्रांस का मानचित्र.

जनगणना हर घर से पूछती है कि वहाँ कितने लोग रहते हैं.

Python में Sampling

फ़्रांस में लोग बहुत हैं

लोगों के आइकन के साथ फ़्रांस का मानचित्र.

जनगणना बहुत महँगी होती है!

Python में Sampling

घरों का सैंपलिंग

लोगों के आइकन के साथ फ़्रांस का मानचित्र, जिनमें से कुछ हाइलाइट किए गए हैं.

कुछ घरों से पूछना सस्ता है और जनसंख्या का अनुमान लगाने के लिए आँकड़ों का उपयोग करें.

पूरी जनसंख्या के एक हिस्से पर काम करना sampling कहलाता है

Python में Sampling

Population बनाम sample

Population पूरा डेटासेट है

  • यह जरूरी नहीं कि लोगों को ही दर्शाए
  • आम तौर पर, हमें पूरी population पता नहीं होती

 

Sample वह सबसेट है जिस पर आप गणना करते हैं

Python में Sampling

कॉफ़ी रेटिंग डेटासेट

total_cup_points variety country_of_origin aroma flavor aftertaste body balance
90.58 NA Ethiopia 8.67 8.83 8.67 8.50 8.42
89.92 Other Ethiopia 8.75 8.67 8.50 8.42 8.42
... ... ... ... ... ... ... ...
73.75 NA Vietnam 6.75 6.67 6.5 6.92 6.83

 

  • हर पंक्ति 1 कॉफ़ी को दर्शाती है
  • 1338 पंक्तियाँ
  • हम इसे population मानेंगे
Python में Sampling

पॉइंट्स बनाम फ्लेवर: population

pts_vs_flavor_pop = coffee_ratings[["total_cup_points", "flavor"]]
      total_cup_points  flavor
0                90.58    8.83
1                89.92    8.67
2                89.75    8.50
3                89.00    8.58
4                88.83    8.50
...                ...     ...
1333             78.75    7.58
1334             78.08    7.67
1335             77.17    7.33
1336             75.08    6.83
1337             73.75    6.67

[1338 rows x 2 columns]
Python में Sampling

पॉइंट्स बनाम फ्लेवर: 10-रो sample

pts_vs_flavor_samp = pts_vs_flavor_pop.sample(n=10)
      total_cup_points  flavor
1088             80.33    7.17
1157             79.67    7.42
1267             76.17    7.33
506              83.00    7.67
659              82.50    7.42
817              81.92    7.50
1050             80.67    7.42
685              82.42    7.50
1027             80.92    7.25
62               85.58    8.17

[10 rows x 2 columns]
Python में Sampling

Series के लिए Python sampling

  • pandas DataFrames और Series के लिए .sample() का उपयोग करें
cup_points_samp = coffee_ratings['total_cup_points'].sample(n=10)
1088    80.33
1157    79.67
1267    76.17
...     ... 
685     82.42
1027    80.92
62      85.58
Name: total_cup_points, dtype: float64
Python में Sampling

Population parameters और point estimates

Population parameter वह गणना है जो population डेटासेट पर की जाती है

import numpy as np
np.mean(pts_vs_flavor_pop['total_cup_points'])
82.15120328849028

Point estimate या sample statistic वह गणना है जो sample डेटासेट पर की जाती है

np.mean(cup_points_samp)
81.31800000000001
Python में Sampling

pandas के साथ point estimates

pts_vs_flavor_pop['flavor'].mean()
7.526046337817639
pts_vs_flavor_samp['flavor'].mean()
7.485000000000001
Python में Sampling

अभ्यास करते हैं!

Python में Sampling

Preparing Video For Download...