Adversariální útoky na modely klasifikace textu

Deep Learning for Text with PyTorch

Shubham Jain

Instructor

Co jsou adversariální útoky?

  • Úpravy vstupních dat
  • Nejde o náhodné, ale záměrné škodlivé změny
  • Mohou zásadně ovlivnit rozhodování AI
Deep Learning for Text with PyTorch

Důležitost robustnosti

  • AI rozhoduje, zda jsou komentáře uživatelů toxické nebo neškodné
  • AI neúmyslně zesiluje negativní stereotypy z podjatých dat
  • AI poskytuje zavádějící informace
Deep Learning for Text with PyTorch

Fast Gradient Sign Method (FGSM)

  • Využívá informace o učení modelu
  • Provádí co nejmenší změnu ke klamání modelu

Útok FGSM

Deep Learning for Text with PyTorch

Projected Gradient Descent (PGD)

  • Pokročilejší než FGSM: je iterativní
  • Hledá nejúčinnější narušení

Útok PGD

Deep Learning for Text with PyTorch

Útok Carlini & Wagner (C&W)

  • Zaměřuje se na optimalizaci ztrátové funkce
  • Nejde jen o klamání, ale i o neodhalitelnost

Útok C&W

Deep Learning for Text with PyTorch

Budování obrany: strategie

  • Ensembling modelů:
    • Použití více modelů

 

  • Robustní rozšíření dat:
    • Augmentace dat

 

  • Adversariální trénink:
    • Anticipace podvodu

Ensembling modelů

Deep Learning for Text with PyTorch

Budování obrany: nástroje a techniky

  • PyTorch Robustness Toolbox:
    • Posílení textových modelů

 

  • Maskování gradientu:
    • Přidání variability do trénovacích dat ke skrytí zneužitelných vzorů

 

  • Regularizační techniky:
    • Zajištění rovnováhy modelu

Python Robustness Toolbox

Maskování gradientu

Regularizační techniky

1 https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Deep Learning for Text with PyTorch

Pojďme procvičovat!

Deep Learning for Text with PyTorch

Preparing Video For Download...