P 值、α 与错误

Python 实验设计

James Chapman

Curriculum Manager, DataCamp

P 值与 α

 

  • P 值:在原假设为真时观察到数据的概率

  • $\alpha$:判定结果为"统计显著"的阈值

  • P 值 $\le \alpha$:拒绝原假设,支持备择假设

 

西洋双陆棋棋盘

Python 实验设计

数据集:作物产量

crop_yields.head()
  Fertilizer_Type  Crop_Yield
0         Organic      26.225
1       Synthetic      17.452
2         Organic      22.283
3       Synthetic      23.548
4       Synthetic      24.138
Python 实验设计

可视化数据

import seaborn as sns
sns.displot(data=crop_data, x="Crop_Yield", hue="Fertilizer_Type", kind="kde")

核密度估计对比图

Python 实验设计

进行独立样本 t 检验

$\alpha = 0.05$

from scipy.stats import ttest_ind
organic_yield = crop_yields[crop_yields['Fertilizer_Type'] == 'Organic']
['Crop_Yield']
synthetic_yield = crop_yields[crop_yields['Fertilizer_Type'] == 'Synthetic']
['Crop_Yield']
t_stat, p_val = ttest_ind(organic_yield, synthetic_yield)
print(p_val)
1.8496748715743899e-209
Python 实验设计

实验错误概览

一张总结统计错误的表:I 型错误是在原假设为真时被错误地拒绝。II 型错误是在原假设为假时未能拒绝。

  • I 型错误:假阳性,错误地拒绝真实的原假设
  • II 型错误:假阴性,未能拒绝错误的原假设
Python 实验设计

更多关于 α

  • 常见取值:0.05、0.01、0.10
    • 分别表示发生 I 型错误的概率为 5%、1%、10%
  • 选择 $\alpha$
    • 基于研究情境
    • 权衡可接受的 I 型错误
  • 约定:
    • 0.05(5%):最常用,通行做法
    • 0.01(1%):更严格,I 型错误代价高时
    • 0.10(10%):有时用于初步研究,容忍度更高
Python 实验设计

Passons à la pratique !

Python 实验设计

Preparing Video For Download...