Состязательные атаки на модели классификации текста
Глубокое обучение для работы с текстом на PyTorch
Shubham Jain
Instructor
Что такое состязательные атаки?
Изменения входных данных
Не случайные, а намеренно вычисленные изменения
Могут существенно влиять на решения ИИ
Важность устойчивости
ИИ определяет, токсичны или безвредны комментарии пользователей
ИИ непреднамеренно усиливает негативные стереотипы из смещённых данных
ИИ выдаёт вводящую в заблуждение информацию
Метод быстрого знакового градиента (FGSM)
Использует сведения об обучении модели
Вносит минимальные изменения, чтобы обмануть модель
Проецируемый градиентный спуск (PGD)
Сложнее FGSM: итеративный метод
Ищет наиболее эффективное возмущение
Атака Карлини и Вагнера (C&W)
Оптимизирует функцию потерь
Цель — не просто обмануть модель, но и остаться незамеченным
Построение защиты: стратегии
Ансамблирование моделей:
Использование нескольких моделей
Устойчивое расширение данных:
Аугментация данных
Состязательное обучение:
Предвосхищение обмана
Построение защиты: инструменты и методы
PyTorch Robustness Toolbox:
Повышение устойчивости текстовых моделей
Маскировка градиента:
Разнообразие обучающих данных для скрытия уязвимых паттернов
Методы регуляризации:
Обеспечение баланса модели
1
https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Давайте потренируемся!
Глубокое обучение для работы с текстом на PyTorch
Preparing Video For Download...