Intervaly spolehlivosti

Vzorkování v Pythonu

James Chapman

Curriculum Manager, DataCamp

Intervaly spolehlivosti

  • „Hodnoty v rozsahu jedné směrodatné odchylky od průměru" zahrnuje velké množství hodnot z každého z těchto rozdělení
  • Definujeme příbuzný pojem zvaný interval spolehlivosti
Vzorkování v Pythonu

Předpovídání počasí

  • Rapid City v Jižní Dakotě (USA) má nejméně předvídatelné počasí
  • Naším úkolem je předpovědět tamní maximální teplotu na zítřek

Mapa počasí s barevným vyznačením předvídatelnosti jednotlivých oblastí.

Vzorkování v Pythonu

Naše předpověď počasí

  • Bodový odhad = 47°F (8,3°C)
  • Rozsah pravděpodobných hodnot maxima = 40 až 54°F (4,4 až 12,8°C)
Vzorkování v Pythonu

Právě jsme uvedli interval spolehlivosti!

  • 40 až 54°F je interval spolehlivosti
  • Někdy zapisován jako 47 °F (40°F, 54°F) nebo 47°F [40°F, 54°F]
  • ... nebo 47 ± 7°F
  • 7°F je pravděpodobná chyba
Vzorkování v Pythonu

Bootstrapové rozdělení průměrné chuti

import matplotlib.pyplot as plt
plt.hist(coffee_boot_distn, bins=15)
plt.show()

Histogram průměrné chuti kávy.

Vzorkování v Pythonu

Průměr převzorkování

import numpy as np
np.mean(coffee_boot_distn)
7.513452892

Histogram průměrné chuti kávy s průměrem vyznačeným svislou černou čarou.

Vzorkování v Pythonu

Průměr plus/minus jedna směrodatná odchylka

np.mean(coffee_boot_distn)
7.513452892
np.mean(coffee_boot_distn) - np.std(coffee_boot_distn, ddof=1)
7.497385709174466
np.mean(coffee_boot_distn) + np.std(coffee_boot_distn, ddof=1)
7.529520074825534

Histogram průměrné chuti kávy s průměrem a směrodatnými odchylkami vyznačenými svislými čarami.

Vzorkování v Pythonu

Kvantilová metoda pro intervaly spolehlivosti

np.quantile(coffee_boot_distn, 0.025)
7.4817195
np.quantile(coffee_boot_distn, 0.975)
7.5448805

95% interval spolehlivosti vyznačený na číselné ose.

Vzorkování v Pythonu

Inverzní kumulativní distribuční funkce

  • PDF: Gaussova křivka
  • CDF: integrací získáme plochu pod křivkou
  • Inv. CDF: prohození os x a y

V Pythonu implementováno pomocí

from scipy.stats import norm
norm.ppf(quantile, loc=0, scale=1)

Inverzní kumulativní distribuční funkce.

Vzorkování v Pythonu

Metoda směrodatné chyby pro interval spolehlivosti

point_estimate = np.mean(coffee_boot_distn)
7.513452892
std_error = np.std(coffee_boot_distn, ddof=1)
0.016067182825533724
from scipy.stats import norm
lower = norm.ppf(0.025, loc=point_estimate, scale=std_error)
upper = norm.ppf(0.975, loc=point_estimate, scale=std_error)
print((lower, upper))
(7.481961792328933, 7.544943991671067)
Vzorkování v Pythonu

Pojďme si procvičit!

Vzorkování v Pythonu

Preparing Video For Download...