Vzorkování a zkreslení

Základy statistické inference v Pythonu

Paul Savala

Assistant Professor of Mathematics

Zkreslení

  • Zkreslený vzorek: Skupina se ve vzorku vyskytuje častěji/méně než v populaci

Skupina lidí v různobarevných tričkách, přičemž vzorek obsahuje pouze osoby v zeleném tričku.

Základy statistické inference v Pythonu

Zkreslené vzorky

all_salaries = [75000, 82000, ...]
friends_salaries = [93000, 87000, 103000, 101000]

np.mean(friends_salaries)
96000
Základy statistické inference v Pythonu

Výběrové rozdělení

sampling_distribution = []

for i in range(100):
random_sample = np.random.choice(salaries, size=10) sample_mean = np.mean(random_sample)
sampling_distribution.append(sample_mean)
plt.hist(sampling_distribution) plt.xlabel('Mean salary') plt.ylabel('Percent of samples') plt.title('Sampling distribution of mean salaries') plt.show()
Základy statistické inference v Pythonu

Histogram zobrazující výběrové rozdělení průměrných platů. Přibližně zvonovitá křivka se středem kolem 82 000 dolarů, minimem kolem 70 000 dolarů a maximem kolem 95 000 dolarů.

Základy statistické inference v Pythonu

Závisí na vzorku

  • Vzorky ovlivňují bodové odhady
  • Bodové odhady ovlivňují inference
  • Vzorky ovlivňují výpočty p-hodnot
Základy statistické inference v Pythonu

Nezávisí na vzorku

  • Populační statistika
    • Není ovlivněna zvoleným vzorkem
  • Závěr testu
    • Na základě p-hodnoty není závěr ovlivněn zvoleným vzorkem
Základy statistické inference v Pythonu

Pojďme procvičovat!

Základy statistické inference v Pythonu

Preparing Video For Download...