Adversariální útoky na modely klasifikace textu
Deep Learning for Text with PyTorch
Shubham Jain
Instructor
Co jsou adversariální útoky?
Úpravy vstupních dat
Nejde o náhodné, ale záměrné škodlivé změny
Mohou zásadně ovlivnit rozhodování AI
Důležitost robustnosti
AI rozhoduje, zda jsou komentáře uživatelů toxické nebo neškodné
AI neúmyslně zesiluje negativní stereotypy z podjatých dat
AI poskytuje zavádějící informace
Fast Gradient Sign Method (FGSM)
Využívá informace o učení modelu
Provádí co nejmenší změnu ke klamání modelu
Projected Gradient Descent (PGD)
Pokročilejší než FGSM: je iterativní
Hledá nejúčinnější narušení
Útok Carlini & Wagner (C&W)
Zaměřuje se na optimalizaci ztrátové funkce
Nejde jen o klamání, ale i o neodhalitelnost
Budování obrany: strategie
Ensembling modelů:
Použití více modelů
Robustní rozšíření dat:
Augmentace dat
Adversariální trénink:
Anticipace podvodu
Budování obrany: nástroje a techniky
PyTorch Robustness Toolbox:
Posílení textových modelů
Maskování gradientu:
Přidání variability do trénovacích dat ke skrytí zneužitelných vzorů
Regularizační techniky:
Zajištění rovnováhy modelu
1
https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Pojďme procvičovat!
Deep Learning for Text with PyTorch
Preparing Video For Download...