信頼区間とサンプリング

Pythonで学ぶ推測の基礎

Paul Savala

Assistant Professor of Mathematics

信頼区間とは?

  • 標本から値の範囲を算出
  • その範囲で母集団統計量を推定

例:

  • 従業員100人の標本
  • 平均給与 $80,000
  • 標準偏差 $10,000

左が7万8040ドル、右が8万1959ドル、中央が8万ドルの信頼区間。

Pythonで学ぶ推測の基礎

信頼区間の計算

from scipy import stats
import numpy as np


ci = stats.norm.interval(loc=80000, # Mean
scale=10000/np.sqrt(100), # Standard error
alpha=0.95) # Confidence level
print(ci)
(78040.04, 81959.96)

妥当な推論には正規な標本分布が必要

Pythonで学ぶ推測の基礎

中心極限定理

  • 多くの独立標本の平均をとる
  • 標本分布はおおむね正規形
population = [0, 1, 2, 3, 4, 5, 6, 7, 8, 9]
sample_means = []

for i in range(1000):
sample_5 = np.random.choice(population, size=5)
sample_means.append(sample_5.mean())
Pythonで学ぶ推測の基礎
plt.hist(sample_means)

x軸「標本平均」、y軸「度数」、タイトル「標本分布」。正規分布に近いヒストグラムが5を中心に描かれている。

Pythonで学ぶ推測の基礎

高層ビルと老朽化した小さな家が混在する大都市。

Pythonで学ぶ推測の基礎

信頼区間が示すこと

(そして、何を示さないか)

  • 母集団統計量が信頼区間内にある/ない
  • 繰り返し標本では、95%の信頼区間が母集団統計量を含む
Pythonで学ぶ推測の基礎

Let's practice!

Pythonで学ぶ推測の基礎

Preparing Video For Download...