Testování hypotéz v Pythonu
James Chapman
Curriculum Manager, DataCamp
age_first_code_cut klasifikuje, kdy uživatel Stack Overflow začal programovat"adult" znamená, že začal ve 14 letech nebo později"child" znamená, že začal před 14. rokemHypotéza je tvrzení o neznámém parametru populace
Testování hypotéz je test dvou konkurenčních hypotéz
Nulová hypotéza ($H_{0}$) je stávající tvrzení
Alternativní hypotéza ($H_{A}$) je nová „protichůdná“ myšlenka výzkumníka
Pro náš problém:
Hladina významnosti je „nade vši pochybnost“ pro testování hypotéz

Testy hypotéz ověřují, zda výběrové statistiky leží v chvostech nulového rozdělení
| Test | Chvosty |
|---|---|
| alternativa odlišná od nulové | oboustranný |
| alternativa větší než nulová | pravostranný |
| alternativa menší než nulová | levostranný |
$H_{A}$: Podíl datových vědců, kteří začali programovat v dětství, je vyšší než 35 %
Jedná se o pravostranný test

p-hodnoty: pravděpodobnost dosažení výsledku za předpokladu platnosti nulové hypotézy
prop_child_samp = (stack_overflow['age_first_code_cut'] == "child").mean()
0.39141972578505085
prop_child_hyp = 0.35
std_error = np.std(first_code_boot_distn, ddof=1)
0.010351057228878566
z_score = (prop_child_samp - prop_child_hyp) / std_error
4.001497129152506
norm.cdf() je normální CDF z scipy.stats.norm.cdf().1 - norm.cdf().
from scipy.stats import norm
1 - norm.cdf(z_score, loc=0, scale=1)
3.1471479512323874e-05
Testování hypotéz v Pythonu