中心极限定理

Python 统计学入门

Maggie Matsui

Content Developer, DataCamp

掷骰子 5 次

die = pd.Series([1, 2, 3, 4, 5, 6])

# 掷 5 次 samp_5 = die.sample(5, replace=True) print(samp_5)
array([3, 1, 4, 1, 1])
np.mean(samp_5)
2.0

 

六面骰子

Python 统计学入门

掷骰子 5 次

# 掷 5 次并取均值
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
4.4
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
3.8
Python 统计学入门

掷骰子 5 次,共 10 轮

重复 10 次:

  • 掷 5 次
  • 取均值
sample_means = []

for i in range(10):
samp_5 = die.sample(5, replace=True) sample_means.append(np.mean(samp_5))
print(sample_means)
[3.8, 4.0, 3.8, 3.6, 3.2, 4.8, 2.6,
3.0, 2.6, 2.0]
Python 统计学入门

抽样分布

样本均值的抽样分布

10 个样本均值的直方图

Python 统计学入门

100 个样本均值

sample_means = []
for i in range(100):
    sample_means.append(np.mean(die.sample(5, replace=True)))

100 个样本均值的直方图

Python 统计学入门

1000 个样本均值

sample_means = []
for i in range(1000):
    sample_means.append(np.mean(die.sample(5, replace=True)))

1000 个样本均值的直方图

Python 统计学入门

中心极限定理

随着试验次数增加,统计量的抽样分布更接近正态分布。

10、100、1000 个样本均值的直方图;样本数越多,分布越像钟形曲线

 

* 样本应当是随机且独立的

Python 统计学入门

标准差与中心极限定理

sample_sds = []
for i in range(1000):
  sample_sds.append(np.std(die.sample(5, replace=True)))

1000 组 5 次掷骰样本标准差的分布

Python 统计学入门

比例与中心极限定理

sales_team = pd.Series(["Amir", "Brian", "Claire", "Damian"])

sales_team.sample(10, replace=True)
array(['Claire', 'Damian', 'Brian', 'Damian', 'Damian', 'Amir', 'Amir', 'Amir', 
      'Amir', 'Damian'], dtype=object)
sales_team.sample(10, replace=True)
array(['Brian', 'Amir', 'Brian', 'Claire', 'Brian', 'Damian', 'Claire', 'Brian', 
      'Claire', 'Claire'], dtype=object)
Python 统计学入门

比例的抽样分布

样本比例的抽样分布也近似正态

Python 统计学入门

抽样分布的均值

# 估计骰子的期望值
np.mean(sample_means)
3.48
# 估计 "Claire" 的比例
np.mean(sample_props)
0.26

样本均值的抽样分布(中间有虚线)  

  • 估计未知总体分布的特征
  • 更易估计大型总体的特征
Python 统计学入门

Passons à la pratique !

Python 统计学入门

Preparing Video For Download...