Konfidensintervall och sampling

Grunderna i inferens med Python

Paul Savala

Assistant Professor of Mathematics

Vad är ett konfidensintervall?

  • Använder urval för att generera ett värdeintervall
  • Intervallet skattar populationsparametern

Exempel:

  • Urval på 100 anställda
  • Medellön 80 000 dollar
  • Standardavvikelse 10 000 dollar

Ett konfidensintervall med 78 040 dollar till vänster, 81 959 dollar till höger och 80 000 dollar i mitten.

Grunderna i inferens med Python

Beräkna ett konfidensintervall

from scipy import stats
import numpy as np


ci = stats.norm.interval(loc=80000, # Mean
scale=10000/np.sqrt(100), # Standard error
alpha=0.95) # Confidence level
print(ci)
(78040.04, 81959.96)

Giltig inferens kräver en normalfördelad samplingsdistribution

Grunderna i inferens med Python

Centrala gränsvärdessatsen

  • Medelvärde av många oberoende urval
  • Samplingsdistributionen är approximativt normalfördelad
population = [0, 1, 2, 3, 4, 5, 6, 7, 8, 9]
sample_means = []

for i in range(1000):
sample_5 = np.random.choice(population, size=5)
sample_means.append(sample_5.mean())
Grunderna i inferens med Python
plt.hist(sample_means)

Ett histogram med "medelvärde av urval" på x-axeln, "förekomster" på y-axeln, titeln "samplingsdistribution" och ett histogram som approximerar en normalfördelning centrerad kring fem.

Grunderna i inferens med Python

En stor stad med en blandning av höghus och mindre förfallna bostäder.

Grunderna i inferens med Python

Vad ett konfidensintervall berättar

(och vad det inte säger oss)

  • Populationsparametern finns eller finns inte i konfidensintervallet
  • Upprepade urval -> 95 % av konfidensintervallen innehåller populationsparametern
Grunderna i inferens med Python

Nu kör vi en övning!

Grunderna i inferens med Python

Preparing Video For Download...