Výběr vzorků a bodové odhady

Vzorkování v Pythonu

James Chapman

Curriculum Manager, DataCamp

Odhad počtu obyvatel Francie

Mapa Francie.

Sčítání lidu zjišťuje počet obyvatel v každé domácnosti.

Vzorkování v Pythonu

Francie má mnoho obyvatel

Mapa Francie s ikonami lidí.

Sčítání lidu je velmi nákladné!

Vzorkování v Pythonu

Vzorkování domácností

Mapa Francie s ikonami lidí, z nichž některé jsou zvýrazněny.

Je levnější dotázat se malého počtu domácností a pomocí statistik odhadnout celou populaci

Práce s podmnožinou celé populace se nazývá vzorkování

Vzorkování v Pythonu

Populace vs. vzorek

Populace je kompletní datová sada

  • Nemusí odkazovat na lidi
  • Celá populace obvykle není známa

 

Vzorek je podmnožina dat, se kterou pracujete

Vzorkování v Pythonu

Datová sada hodnocení kávy

total_cup_points variety country_of_origin aroma flavor aftertaste body balance
90.58 NA Ethiopia 8.67 8.83 8.67 8.50 8.42
89.92 Other Ethiopia 8.75 8.67 8.50 8.42 8.42
... ... ... ... ... ... ... ...
73.75 NA Vietnam 6.75 6.67 6.5 6.92 6.83

 

  • Každý řádek představuje 1 kávu
  • 1338 řádků
  • Tato data budeme považovat za populaci
Vzorkování v Pythonu

Body vs. chuť: populace

pts_vs_flavor_pop = coffee_ratings[["total_cup_points", "flavor"]]
      total_cup_points  flavor
0                90.58    8.83
1                89.92    8.67
2                89.75    8.50
3                89.00    8.58
4                88.83    8.50
...                ...     ...
1333             78.75    7.58
1334             78.08    7.67
1335             77.17    7.33
1336             75.08    6.83
1337             73.75    6.67

[1338 rows x 2 columns]
Vzorkování v Pythonu

Body vs. chuť: vzorek 10 řádků

pts_vs_flavor_samp = pts_vs_flavor_pop.sample(n=10)
      total_cup_points  flavor
1088             80.33    7.17
1157             79.67    7.42
1267             76.17    7.33
506              83.00    7.67
659              82.50    7.42
817              81.92    7.50
1050             80.67    7.42
685              82.42    7.50
1027             80.92    7.25
62               85.58    8.17

[10 rows x 2 columns]
Vzorkování v Pythonu

Vzorkování Series v Pythonu

  • Pro výběr vzorků z pandas DataFrames a Series použijte .sample()
cup_points_samp = coffee_ratings['total_cup_points'].sample(n=10)
1088    80.33
1157    79.67
1267    76.17
...     ... 
685     82.42
1027    80.92
62      85.58
Name: total_cup_points, dtype: float64
Vzorkování v Pythonu

Parametry populace a bodové odhady

Parametr populace je výpočet provedený na celé datové sadě populace

import numpy as np
np.mean(pts_vs_flavor_pop['total_cup_points'])
82.15120328849028

Bodový odhad nebo výběrová statistika je výpočet provedený na datové sadě vzorku

np.mean(cup_points_samp)
81.31800000000001
Vzorkování v Pythonu

Bodové odhady pomocí pandas

pts_vs_flavor_pop['flavor'].mean()
7.526046337817639
pts_vs_flavor_samp['flavor'].mean()
7.485000000000001
Vzorkování v Pythonu

Pojďme si procvičit!

Vzorkování v Pythonu

Preparing Video For Download...