对文本分类模型的对抗性攻击
使用 PyTorch 的文本深度学习
Shubham Jain
Instructor
什么是对抗性攻击?
对输入数据的小幅修改
非随机而是精心计算的恶意更改
可显著影响 AI 的决策
稳健性的重要性
AI 判定用户评论是否有毒或良性
AI 从偏见数据中无意放大负面刻板印象
AI 提供误导性信息
快速梯度符号法(FGSM)
利用模型的学习信息
以最小改动欺骗模型
投影梯度下降(PGD)
比 FGSM 更高级:迭代进行
寻找最有效的扰动
Carlini & Wagner(C&W)攻击
专注优化损失函数
不仅要欺骗,还要难以察觉
构建防御:策略
模型集成:
使用多个模型
稳健数据增强:
数据增广
对抗训练:
预判并防范欺骗
构建防御:工具与技术
PyTorch 的稳健性工具箱:
加强文本模型
梯度屏蔽:
为训练数据增加多样性以隐藏可利用模式
正则化技术:
保持模型平衡
1
https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Ayo berlatih!
使用 PyTorch 的文本深度学习
Preparing Video For Download...