Вибірка та точкові оцінки

Sampling у Python

James Chapman

Curriculum Manager, DataCamp

Оцінювання населення Франції

Карта Франції.

Під час перепису в кожного домогосподарства запитують, скільки людей там живе.

Sampling у Python

У Франції багато людей

Карта Франції з іконками людей.

Переписи дуже дорогі!

Sampling у Python

Вибірка домогосподарств

Карта Франції з іконками людей, частина з яких підсвічена.

Дешевше опитати небагато домогосподарств і за допомогою статистики оцінити чисельність населення

Робота з підмножиною всієї сукупності називається вибіркою

Sampling у Python

Генеральна сукупність vs вибірка

Генеральна сукупність — це повний набір даних

  • Це не обов'язково про людей
  • Зазвичай повну сукупність невідомо

 

Вибірка — це підмножина даних, на якій ви рахуєте

Sampling у Python

Набір даних з оцінками кави

total_cup_points variety country_of_origin aroma flavor aftertaste body balance
90.58 NA Ethiopia 8.67 8.83 8.67 8.50 8.42
89.92 Other Ethiopia 8.75 8.67 8.50 8.42 8.42
... ... ... ... ... ... ... ...
73.75 NA Vietnam 6.75 6.67 6.5 6.92 6.83

 

  • Кожен рядок — це 1 кава
  • 1338 рядків
  • Вважатимемо це генеральною сукупністю
Sampling у Python

Бали vs смак: генеральна сукупність

pts_vs_flavor_pop = coffee_ratings[["total_cup_points", "flavor"]]
      total_cup_points  flavor
0                90.58    8.83
1                89.92    8.67
2                89.75    8.50
3                89.00    8.58
4                88.83    8.50
...                ...     ...
1333             78.75    7.58
1334             78.08    7.67
1335             77.17    7.33
1336             75.08    6.83
1337             73.75    6.67

[1338 rows x 2 columns]
Sampling у Python

Бали vs смак: вибірка з 10 рядків

pts_vs_flavor_samp = pts_vs_flavor_pop.sample(n=10)
      total_cup_points  flavor
1088             80.33    7.17
1157             79.67    7.42
1267             76.17    7.33
506              83.00    7.67
659              82.50    7.42
817              81.92    7.50
1050             80.67    7.42
685              82.42    7.50
1027             80.92    7.25
62               85.58    8.17

[10 rows x 2 columns]
Sampling у Python

Вибірка в Python для Series

  • Використовуйте .sample() для датафреймів і серій pandas
cup_points_samp = coffee_ratings['total_cup_points'].sample(n=10)
1088    80.33
1157    79.67
1267    76.17
...     ... 
685     82.42
1027    80.92
62      85.58
Name: total_cup_points, dtype: float64
Sampling у Python

Параметри сукупності та точкові оцінки

Параметр сукупності — це обчислення на всій генеральній сукупності

import numpy as np
np.mean(pts_vs_flavor_pop['total_cup_points'])
82.15120328849028

Точкова оцінка або вибіркова статистика — це обчислення на вибірці

np.mean(cup_points_samp)
81.31800000000001
Sampling у Python

Точкові оцінки в pandas

pts_vs_flavor_pop['flavor'].mean()
7.526046337817639
pts_vs_flavor_samp['flavor'].mean()
7.485000000000001
Sampling у Python

Давайте потренуємось!

Sampling у Python

Preparing Video For Download...