統計的有意性

Pythonで学ぶ仮説検定

James Chapman

Curriculum Manager, DataCamp

p値の復習

  • p値は帰無仮説の証拠の強さを示す
  • p値が大きい → 帰無仮説は棄却しない
  • p値が小さい → 帰無仮説を棄却
  • しきい値はどこか?
Pythonで学ぶ仮説検定

有意水準

仮説検定の「有意水準」($\alpha$)は「合理的な疑いを超える」のしきい値

  • 一般的な $\alpha$ は 0.20.10.050.01
  • $p \le \alpha$ なら $H_{0}$ を棄却、そうでなければ棄却しない
  • $\alpha$ は検定の実施前に設定する
Pythonで学ぶ仮説検定

p値の計算

alpha = 0.05

prop_child_samp = (stack_overflow['age_first_code_cut'] == "child").mean() prop_child_hyp = 0.35
std_error = np.std(first_code_boot_distn, ddof=1)
z_score = (prop_child_samp - prop_child_hyp) / std_error
p_value = 1 - norm.cdf(z_score, loc=0, scale=1)
3.1471479512323874e-05
Pythonで学ぶ仮説検定

意思決定

alpha = 0.05

print(p_value)
3.1471479512323874e-05
p_value <= alpha
True

$H_{0}$ を棄却し、$H_{A}$ を支持する

Pythonで学ぶ仮説検定

信頼区間

有意水準 $\alpha$ に対し、信頼区間は一般に 1 − $\alpha$

  • $\alpha=0.05$ → $95\%$ 信頼区間
import numpy as np
lower = np.quantile(first_code_boot_distn, 0.025)
upper = np.quantile(first_code_boot_distn, 0.975)
print((lower, upper))
(0.37063246351172047, 0.41132242370632466)
Pythonで学ぶ仮説検定

誤りの種類

実際は無罪 実際は有罪
評決 無罪 正しい 逃げ切り
評決 有罪 冤罪 正しい

 

真の $H_{0}$ 真の $H_{A}$
選択 $H_{0}$ 正しい 偽陰性
選択 $H_{A}$ 偽陽性 正しい

 

偽陽性は「第I種の誤り」、偽陰性は「第II種の誤り」です。

Pythonで学ぶ仮説検定

この例で起こりうる誤り

もし $p \le \alpha$ なら、$H_{0}$ を棄却:

  • 偽陽性(第I種の誤り): データサイエンティストは子供の頃からのコーディング率が高くなかった

もし $ p \gt \alpha$ なら、$H_{0}$ を棄却できない:

  • 偽陰性(第II種の誤り): データサイエンティストは子供の頃からのコーディング率が高かった
Pythonで学ぶ仮説検定

練習しましょう!

Pythonで学ぶ仮説検定

Preparing Video For Download...