中央極限定理

Python 統計學入門

Maggie Matsui

Content Developer, DataCamp

擲骰 5 次

die = pd.Series([1, 2, 3, 4, 5, 6])

# Roll 5 times samp_5 = die.sample(5, replace=True) print(samp_5)
array([3, 1, 4, 1, 1])
np.mean(samp_5)
2.0

 

六面骰

Python 統計學入門

擲骰 5 次

# Roll 5 times and take mean
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
4.4
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
3.8
Python 統計學入門

擲骰 5 次共 10 輪

重複 10 次:

  • 擲 5 次
  • 取平均
sample_means = []

for i in range(10):
samp_5 = die.sample(5, replace=True) sample_means.append(np.mean(samp_5))
print(sample_means)
[3.8, 4.0, 3.8, 3.6, 3.2, 4.8, 2.6,
3.0, 2.6, 2.0]
Python 統計學入門

抽樣分配

樣本平均的抽樣分配

10 個樣本平均的長條圖

Python 統計學入門

100 個樣本平均

sample_means = []
for i in range(100):
    sample_means.append(np.mean(die.sample(5, replace=True)))

100 個樣本平均的長條圖

Python 統計學入門

1000 個樣本平均

sample_means = []
for i in range(1000):
    sample_means.append(np.mean(die.sample(5, replace=True)))

1000 個樣本平均的長條圖

Python 統計學入門

中央極限定理

某統計量的抽樣分配,隨試驗次數增加,會越接近常態分配。

10、100、1000 個樣本平均的長條圖;數量越多,分配越像鐘形曲線

 

* 樣本需隨機且相互獨立

Python 統計學入門

標準差與 CLT

sample_sds = []
for i in range(1000):
  sample_sds.append(np.std(die.sample(5, replace=True)))

擲 5 次骰子之樣本標準差的 1000 次分配

Python 統計學入門

比例與 CLT

sales_team = pd.Series(["Amir", "Brian", "Claire", "Damian"])

sales_team.sample(10, replace=True)
array(['Claire', 'Damian', 'Brian', 'Damian', 'Damian', 'Amir', 'Amir', 'Amir', 
      'Amir', 'Damian'], dtype=object)
sales_team.sample(10, replace=True)
array(['Brian', 'Amir', 'Brian', 'Claire', 'Brian', 'Damian', 'Claire', 'Brian', 
      'Claire', 'Claire'], dtype=object)
Python 統計學入門

比例的抽樣分配

樣本比例的分配也近似常態

Python 統計學入門

抽樣分配的平均

# Estimate expected value of die
np.mean(sample_means)
3.48
# Estimate proportion of "Claire"s
np.mean(sample_props)
0.26

樣本平均的抽樣分配,中線為虛線  

  • 估計未知母體分配的特性
  • 更容易估計大型母體的特性
Python 統計學入門

一起來練習吧!

Python 統計學入門

Preparing Video For Download...