评估与缓解社会偏见

生成式 AI 概念

Daniel Tedesco

Data Lead, Google

我们所说的社会偏见是什么?

$$ $$

生成式 AI 的系统性不公

  • 严重的社会后果
  • 公平性可能主观
  • 聚焦广泛共识的价值观

$$ $$

一场求职面试。

生成式 AI 概念

偏见出现的环节

  • 训练数据
  • 模型本身
  • 模型的使用方式

不平衡的天平

生成式 AI 概念

数据中的偏见

训练数据集中偏斜缺乏代表性的信息

两个训练漏斗。一个只输入紫色方块并只生成紫色方块;另一个输入多种颜色形状并生成多种形状

生成式 AI 概念

模型中的偏见

追求会导致偏见结果的目标

逼真的机器人政治家在联合国发表演讲

生成式 AI 概念

使用中的偏见

以错误或恶意方式应用 AI

笔记本电脑上播放的视频,标有巨大的"FAKE"字样。

生成式 AI 概念

识别数据与模型中的偏见

  • 进行表征分析,比较模型如何指称不同群体
  • 公平性指标评估各群体在待遇、机会与准确性上的一致性
  • 人工审查:由真实用户评阅模型输出以发现偏见
生成式 AI 概念

缓解数据与模型偏见

 

  • 多样化数据收集
  • 调整模型以平衡不同数据的权重
  • 对抗训练
  • 持续改进

不同颜色形状的集合,并选出了具有代表性的样本

生成式 AI 概念

让我们来练习!

生成式 AI 概念

Preparing Video For Download...