Przedziały ufności

Próbkowanie w Pythonie

James Chapman

Curriculum Manager, DataCamp

Przedziały ufności

  • „Wartości w odległości jednego odchylenia standardowego od średniej" obejmują dużą liczbę wartości z każdego z tych rozkładów
  • Zdefiniujemy pokrewne pojęcie zwane przedziałem ufności
Próbkowanie w Pythonie

Prognozowanie pogody

  • Rapid City w Dakocie Południowej (USA) ma najmniej przewidywalną pogodę
  • Naszym zadaniem jest przewidzenie jutrzejszej temperatury maksymalnej

Mapa pogody z kolorami wskazującymi przewidywalność poszczególnych regionów.

Próbkowanie w Pythonie

Nasza prognoza pogody

  • Estymacja punktowa = 47°F (8,3°C)
  • Przedział wiarygodnych wartości temperatury maksymalnej = 40–54°F (4,4–12,8°C)
Próbkowanie w Pythonie

Właśnie podaliśmy przedział ufności!

  • 40–54°F to przedział ufności
  • Zapisywany też jako 47°F (40°F, 54°F) lub 47°F [40°F, 54°F]
  • ... lub 47 ± 7°F
  • 7°F to margines błędu
Próbkowanie w Pythonie

Rozkład bootstrapowy średniej oceny smaku

import matplotlib.pyplot as plt
plt.hist(coffee_boot_distn, bins=15)
plt.show()

Histogram średniej oceny smaku kawy.

Próbkowanie w Pythonie

Średnia z próbek bootstrapowych

import numpy as np
np.mean(coffee_boot_distn)
7.513452892

Histogram średniej oceny smaku kawy z zaznaczoną średnią pionową czarną linią.

Próbkowanie w Pythonie

Średnia ± jedno odchylenie standardowe

np.mean(coffee_boot_distn)
7.513452892
np.mean(coffee_boot_distn) - np.std(coffee_boot_distn, ddof=1)
7.497385709174466
np.mean(coffee_boot_distn) + np.std(coffee_boot_distn, ddof=1)
7.529520074825534

Histogram średnich ocen smaku kawy z zaznaczonymi średnią i odchyleniami standardowymi pionowymi liniami.

Próbkowanie w Pythonie

Metoda kwantylowa dla przedziałów ufności

np.quantile(coffee_boot_distn, 0.025)
7.4817195
np.quantile(coffee_boot_distn, 0.975)
7.5448805

Linia 95-procentowego przedziału ufności.

Próbkowanie w Pythonie

Odwrotna dystrybuanta

  • PDF: krzywa dzwonowa
  • CDF: całkowanie – pole pod krzywą dzwonową
  • Odwrotna CDF: zamiana osi x i y

Implementacja w Pythonie za pomocą

from scipy.stats import norm
norm.ppf(quantile, loc=0, scale=1)

Odwrotna dystrybuanta.

Próbkowanie w Pythonie

Metoda błędu standardowego dla przedziału ufności

point_estimate = np.mean(coffee_boot_distn)
7.513452892
std_error = np.std(coffee_boot_distn, ddof=1)
0.016067182825533724
from scipy.stats import norm
lower = norm.ppf(0.025, loc=point_estimate, scale=std_error)
upper = norm.ppf(0.975, loc=point_estimate, scale=std_error)
print((lower, upper))
(7.481961792328933, 7.544943991671067)
Próbkowanie w Pythonie

Czas na ćwiczenia!

Próbkowanie w Pythonie

Preparing Video For Download...