Intervaly spolehlivosti a vzorkování

Základy statistické inference v Pythonu

Paul Savala

Assistant Professor of Mathematics

Co je interval spolehlivosti?

  • Používá vzorky k vytvoření rozsahu hodnot
  • Rozsah hodnot odhaduje populační statistiku

Příklad:

  • Vzorek 100 zaměstnanců
  • Průměrný plat 80 000 $
  • Směrodatná odchylka 10 000 $

Interval spolehlivosti s hodnotou 78 040 $ vlevo, 81 959 $ vpravo a 80 000 $ uprostřed.

Základy statistické inference v Pythonu

Výpočet intervalu spolehlivosti

from scipy import stats
import numpy as np


ci = stats.norm.interval(loc=80000, # Mean
scale=10000/np.sqrt(100), # Standard error
alpha=0.95) # Confidence level
print(ci)
(78040.04, 81959.96)

Platná inference vyžaduje normální rozdělení výběrového rozdělení

Základy statistické inference v Pythonu

Centrální limitní věta

  • Průměr mnoha nezávislých vzorků
  • Výběrové rozdělení je přibližně normální
population = [0, 1, 2, 3, 4, 5, 6, 7, 8, 9]
sample_means = []

for i in range(1000):
sample_5 = np.random.choice(population, size=5)
sample_means.append(sample_5.mean())
Základy statistické inference v Pythonu
plt.hist(sample_means)

Histogram s osou x „průměr vzorku", osou y „četnost", nadpisem „výběrové rozdělení" a přibližně normálním rozdělením se středem v hodnotě 5.

Základy statistické inference v Pythonu

Velké město s kombinací mrakodrapů a menších zchátralých domů.

Základy statistické inference v Pythonu

Co nám říká interval spolehlivosti

(a co nám neříká)

  • Populační statistika leží nebo neleží v intervalu spolehlivosti
  • Opakované vzorky -> 95 % intervalů spolehlivosti obsahuje populační statistiku
Základy statistické inference v Pythonu

Pojďme si procvičit!

Základy statistické inference v Pythonu

Preparing Video For Download...