Przedziały ufności i próbkowanie

Podstawy wnioskowania statystycznego w Pythonie

Paul Savala

Assistant Professor of Mathematics

Czym jest przedział ufności?

  • Używa prób do generowania zakresu wartości
  • Zakres wartości szacuje statystykę populacji

Przykład:

  • Próba 100 pracowników
  • Średnia płaca 80 000 USD
  • Odchylenie standardowe 10 000 USD

Przedział ufności z wartością 78 040 USD po lewej, 81 959 USD po prawej i 80 000 USD pośrodku.

Podstawy wnioskowania statystycznego w Pythonie

Obliczanie przedziału ufności

from scipy import stats
import numpy as np


ci = stats.norm.interval(loc=80000, # Mean
scale=10000/np.sqrt(100), # Standard error
alpha=0.95) # Confidence level
print(ci)
(78040.04, 81959.96)

Poprawne wnioskowanie wymaga normalnego rozkładu próbkowania

Podstawy wnioskowania statystycznego w Pythonie

Centralne twierdzenie graniczne

  • Uśrednij wiele niezależnych prób
  • Rozkład próbkowania jest w przybliżeniu normalny
population = [0, 1, 2, 3, 4, 5, 6, 7, 8, 9]
sample_means = []

for i in range(1000):
sample_5 = np.random.choice(population, size=5)
sample_means.append(sample_5.mean())
Podstawy wnioskowania statystycznego w Pythonie
plt.hist(sample_means)

Histogram z „średnią próby" na osi x, „wystąpieniami" na osi y, tytułem „rozkład próbkowania" i histogramem przybliżającym rozkład normalny skupiony wokół pięciu.

Podstawy wnioskowania statystycznego w Pythonie

Duże miasto z mieszaniną wieżowców i mniejszych, zaniedbanych budynków.

Podstawy wnioskowania statystycznego w Pythonie

Co mówi przedział ufności

(i czego nie mówi)

  • Statystyka populacji jest lub nie jest w przedziale ufności
  • Wielokrotne próby -> 95% przedziałów ufności zawiera statystykę populacji
Podstawy wnioskowania statystycznego w Pythonie

Ćwiczmy!

Podstawy wnioskowania statystycznego w Pythonie

Preparing Video For Download...