Теорема центральної граничної межі

Вступ до Statistics у Python

Maggie Matsui

Content Developer, DataCamp

Кидки кубика 5 разів

die = pd.Series([1, 2, 3, 4, 5, 6])

# Киньте 5 разів samp_5 = die.sample(5, replace=True) print(samp_5)
array([3, 1, 4, 1, 1])
np.mean(samp_5)
2.0

 

гральний кубик з шістьма гранями

Вступ до Statistics у Python

Кидки кубика 5 разів

# Киньте 5 разів і візьміть середнє
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
4.4
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
3.8
Вступ до Statistics у Python

Кидки кубика 5 разів, повторити 10 разів

Повторіть 10 разів:

  • Киньте 5 разів
  • Обчисліть середнє
sample_means = []

for i in range(10):
samp_5 = die.sample(5, replace=True) sample_means.append(np.mean(samp_5))
print(sample_means)
[3.8, 4.0, 3.8, 3.6, 3.2, 4.8, 2.6,
3.0, 2.6, 2.0]
Вступ до Statistics у Python

Вибіркові розподіли

Вибірковий розподіл вибіркового середнього

гістограма 10 вибіркових середніх

Вступ до Statistics у Python

100 вибіркових середніх

sample_means = []
for i in range(100):
    sample_means.append(np.mean(die.sample(5, replace=True)))

гістограма 100 вибіркових середніх

Вступ до Statistics у Python

1000 вибіркових середніх

sample_means = []
for i in range(1000):
    sample_means.append(np.mean(die.sample(5, replace=True)))

гістограма 1000 вибіркових середніх

Вступ до Statistics у Python

Теорема центральної граничної межі

Вибірковий розподіл статистики наближається до нормального розподілу зі збільшенням кількості повторень.

гістограми 10, 100 і 1000 вибіркових середніх; за більшої кількості середніх розподіл стає схожим на дзвіноподібну криву

 

* Вибірки мають бути випадковими та незалежними

Вступ до Statistics у Python

Стандартне відхилення і ТЦГМ

sample_sds = []
for i in range(1000):
  sample_sds.append(np.std(die.sample(5, replace=True)))

Розподіл 1000 вибіркових стандартних відхилень для 5 кидків кубика

Вступ до Statistics у Python

Пропорції і ТЦГМ

sales_team = pd.Series(["Amir", "Brian", "Claire", "Damian"])

sales_team.sample(10, replace=True)
array(['Claire', 'Damian', 'Brian', 'Damian', 'Damian', 'Amir', 'Amir', 'Amir', 
      'Amir', 'Damian'], dtype=object)
sales_team.sample(10, replace=True)
array(['Brian', 'Amir', 'Brian', 'Claire', 'Brian', 'Damian', 'Claire', 'Brian', 
      'Claire', 'Claire'], dtype=object)
Вступ до Statistics у Python

Вибірковий розподіл пропорції

Розподіл вибіркових пропорцій теж виглядає нормальним

Вступ до Statistics у Python

Середнє вибіркового розподілу

# Оцініть сподіване значення кубика
np.mean(sample_means)
3.48
# Оцініть частку "Claire"
np.mean(sample_props)
0.26

Вибірковий розподіл середніх із штриховою лінією посередині  

  • Оцінюйте характеристики невідомого базового розподілу
  • Легше оцінюйте характеристики великих сукупностей
Вступ до Statistics у Python

Давайте потренуємось!

Вступ до Statistics у Python

Preparing Video For Download...