评估与缓解社会偏见
生成式 AI 概念
Daniel Tedesco
Data Lead, Google
我们所说的社会偏见是什么?
$$
$$
生成式 AI 的系统性不公
- 严重的社会后果
- 公平性可能主观
- 聚焦广泛共识的价值观
$$
$$

数据中的偏见
训练数据集中偏斜或缺乏代表性的信息

模型中的偏见
追求会导致偏见结果的目标

使用中的偏见
以错误或恶意方式应用 AI

识别数据与模型中的偏见
- 进行表征分析,比较模型如何指称不同群体
- 用公平性指标评估各群体在待遇、机会与准确性上的一致性
- 人工审查:由真实用户评阅模型输出以发现偏见
缓解数据与模型偏见
- 多样化数据收集
- 调整模型以平衡不同数据的权重
- 对抗训练
- 持续改进
Preparing Video For Download...