Ataki adwersaryjne na modele klasyfikacji tekstu

Uczenie głębokie dla tekstu z PyTorch

Shubham Jain

Instructor

Czym są ataki adwersaryjne?

  • Modyfikacje danych wejściowych
  • Nie losowe, lecz celowo złośliwe zmiany
  • Mogą znacząco wpłynąć na decyzje modelu AI
Uczenie głębokie dla tekstu z PyTorch

Znaczenie odporności modeli

  • Systemy AI oceniające, czy komentarze użytkowników są toksyczne
  • AI nieumyślnie wzmacniająca negatywne stereotypy ze stronniczych danych
  • AI podająca mylące informacje
Uczenie głębokie dla tekstu z PyTorch

Fast Gradient Sign Method (FGSM)

  • Wykorzystuje informacje o uczeniu modelu
  • Wprowadza jak najmniejszą zmianę, aby oszukać model

Atak FGSM

Uczenie głębokie dla tekstu z PyTorch

Projected Gradient Descent (PGD)

  • Bardziej zaawansowany niż FGSM: jest iteracyjny
  • Szuka najbardziej skutecznego zakłócenia

Atak PGD

Uczenie głębokie dla tekstu z PyTorch

Atak Carlini & Wagner (C&W)

  • Koncentruje się na optymalizacji funkcji straty
  • Chodzi nie tylko o oszustwo, ale i o niewykrywalność

Atak C&W

Uczenie głębokie dla tekstu z PyTorch

Budowanie ochrony: strategie

  • Ensembling modeli:
    • Użycie wielu modeli

 

  • Solidna augmentacja danych:
    • Augmentacja danych

 

  • Trening adwersaryjny:
    • Antycypowanie oszustwa

Ensembling modeli

Uczenie głębokie dla tekstu z PyTorch

Budowanie ochrony: narzędzia i techniki

  • PyTorch Robustness Toolbox:
    • Wzmacnianie modeli tekstowych

 

  • Maskowanie gradientu:
    • Urozmaicenie danych treningowych w celu ukrycia exploitowalnych wzorców

 

  • Techniki regularyzacji:
    • Zapewnienie równowagi modelu

Python Robustness Toolbox

Maskowanie gradientu

Techniki regularyzacji

1 https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Uczenie głębokie dla tekstu z PyTorch

Czas na ćwiczenia!

Uczenie głębokie dla tekstu z PyTorch

Preparing Video For Download...