P 值、α 與錯誤

Python 的實驗設計

James Chapman

Curriculum Manager, DataCamp

P 值與 α

 

  • P 值:在虛無假設為真時觀察到資料的機率

  • $\alpha$:判定結果「具統計顯著」的門檻

  • P 值 $\le \alpha$:拒絕虛無假設,採用對立假設

 

西洋雙陸棋棋盤

Python 的實驗設計

資料集:作物產量

crop_yields.head()
  Fertilizer_Type  Crop_Yield
0         Organic      26.225
1       Synthetic      17.452
2         Organic      22.283
3       Synthetic      23.548
4       Synthetic      24.138
Python 的實驗設計

視覺化資料

import seaborn as sns
sns.displot(data=crop_data, x="Crop_Yield", hue="Fertilizer_Type", kind="kde")

核密度估計比較圖

Python 的實驗設計

進行獨立樣本 t 檢定

$\alpha = 0.05$

from scipy.stats import ttest_ind
organic_yield = crop_yields[crop_yields['Fertilizer_Type'] == 'Organic']
['Crop_Yield']
synthetic_yield = crop_yields[crop_yields['Fertilizer_Type'] == 'Synthetic']
['Crop_Yield']
t_stat, p_val = ttest_ind(organic_yield, synthetic_yield)
print(p_val)
1.8496748715743899e-209
Python 的實驗設計

實驗錯誤類型

統計錯誤摘要表:第一類型錯誤為錯誤拒絕真實的虛無假設。第二類型錯誤為未能拒絕實為錯誤的虛無假設。

  • 第一類型錯誤(Type I):偽陽性,錯誤拒絕真實的虛無假設
  • 第二類型錯誤(Type II):偽陰性,未能拒絕錯誤的虛無假設
Python 的實驗設計

更多關於 α

  • 常見值:0.05、0.01、0.10
    • 代表發生第一類型錯誤的機率為 5%、1%、10%
  • 選擇 $\alpha$
    • 依研究情境而定
    • 衡量可接受的第一類型錯誤風險
  • 慣例:
    • 0.05(5%):最常見,作為約定俗成門檻
    • 0.01(1%):更嚴格,當第一類型錯誤代價高
    • 0.10(10%):有時用於前期研究,容忍較高第一類型錯誤
Python 的實驗設計

一起來練習吧!

Python 的實驗設計

Preparing Video For Download...