Атаки суперника на моделі класифікації тексту

Глибоке навчання для тексту з PyTorch

Shubham Jain

Instructor

Що таке атаки суперника?

  • Невеликі зміни у вхідних даних
  • Не випадкові, а навмисно розраховані зміни
  • Можуть суттєво вплинути на рішення ШІ
Глибоке навчання для тексту з PyTorch

Чому важлива стійкість

  • Системи ШІ визначають, чи токсичні коментарі, чи ні
  • ШІ ненавмисно підсилює стереотипи через упереджені дані
  • ШІ надає оманливу інформацію
Глибоке навчання для тексту з PyTorch

Fast Gradient Sign Method (FGSM)

  • Використовує відомості з навчання моделі
  • Вносить мінімальну зміну, щоб обдурити модель

Атака FGSM

Глибоке навчання для тексту з PyTorch

Projected Gradient Descent (PGD)

  • Просунутіший за FGSM: виконується ітеративно
  • Шукає найдієвіше збурення

Атака PGD

Глибоке навчання для тексту з PyTorch

Атака Carlini & Wagner (C&W)

  • Оптимізує функцію втрат
  • Мета не лише обманути, а й лишатися непомітним

Атака C&W

Глибоке навчання для тексту з PyTorch

Побудова захисту: стратегії

  • Комбінування моделей:
    • Використовуйте кілька моделей

 

  • Розширення даних для стійкості:
    • Аугментація даних

 

  • Навчання на атаках:
    • Завчасно врахуйте спроби обману

Комбінування моделей

Глибоке навчання для тексту з PyTorch

Побудова захисту: інструменти й техніки

  • PyTorch's Robustness Toolbox:
    • Посилює текстові моделі

 

  • Gradient Masking:
    • Додавайте різноманітність у навчальні дані, щоб приховати вразливі шаблони

 

  • Методи регуляризації:
    • Підтримуйте збалансованість моделі

Python Robustness toolbox

Gradient Masking

Regularization Techniques

1 https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Глибоке навчання для тексту з PyTorch

Давайте потренуємось!

Глибоке навчання для тексту з PyTorch

Preparing Video For Download...