Атаки суперника на моделі класифікації тексту
Глибоке навчання для тексту з PyTorch
Shubham Jain
Instructor
Що таке атаки суперника?
Невеликі зміни у вхідних даних
Не випадкові, а навмисно розраховані зміни
Можуть суттєво вплинути на рішення ШІ
Чому важлива стійкість
Системи ШІ визначають, чи токсичні коментарі, чи ні
ШІ ненавмисно підсилює стереотипи через упереджені дані
ШІ надає оманливу інформацію
Fast Gradient Sign Method (FGSM)
Використовує відомості з навчання моделі
Вносить мінімальну зміну, щоб обдурити модель
Projected Gradient Descent (PGD)
Просунутіший за FGSM: виконується ітеративно
Шукає найдієвіше збурення
Атака Carlini & Wagner (C&W)
Оптимізує функцію втрат
Мета не лише обманути, а й лишатися непомітним
Побудова захисту: стратегії
Комбінування моделей:
Використовуйте кілька моделей
Розширення даних для стійкості:
Аугментація даних
Навчання на атаках:
Завчасно врахуйте спроби обману
Побудова захисту: інструменти й техніки
PyTorch's Robustness Toolbox:
Посилює текстові моделі
Gradient Masking:
Додавайте різноманітність у навчальні дані, щоб приховати вразливі шаблони
Методи регуляризації:
Підтримуйте збалансованість моделі
1
https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Давайте потренуємось!
Глибоке навчання для тексту з PyTorch
Preparing Video For Download...