对文本分类模型的对抗性攻击

使用 PyTorch 的文本深度学习

Shubham Jain

Instructor

什么是对抗性攻击?

  • 对输入数据的小幅修改
  • 非随机而是精心计算的恶意更改
  • 可显著影响 AI 的决策
使用 PyTorch 的文本深度学习

稳健性的重要性

  • AI 判定用户评论是否有毒或良性
  • AI 从偏见数据中无意放大负面刻板印象
  • AI 提供误导性信息
使用 PyTorch 的文本深度学习

快速梯度符号法(FGSM)

  • 利用模型的学习信息
  • 以最小改动欺骗模型

FGSM 攻击

使用 PyTorch 的文本深度学习

投影梯度下降(PGD)

  • 比 FGSM 更高级:迭代进行
  • 寻找最有效的扰动

PGD 攻击

使用 PyTorch 的文本深度学习

Carlini & Wagner(C&W)攻击

  • 专注优化损失函数
  • 不仅要欺骗,还要难以察觉

C&W 攻击

使用 PyTorch 的文本深度学习

构建防御:策略

  • 模型集成:
    • 使用多个模型

 

  • 稳健数据增强:
    • 数据增广

 

  • 对抗训练:
    • 预判并防范欺骗

模型集成

使用 PyTorch 的文本深度学习

构建防御:工具与技术

  • PyTorch 的稳健性工具箱:
    • 加强文本模型

 

  • 梯度屏蔽:
    • 为训练数据增加多样性以隐藏可利用模式

 

  • 正则化技术:
    • 保持模型平衡

Python 稳健性工具箱

梯度屏蔽

正则化技术

1 https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
使用 PyTorch 的文本深度学习

Ayo berlatih!

使用 PyTorch 的文本深度学习

Preparing Video For Download...