Atacuri adversariale asupra modelelor de clasificare a textului
Deep Learning pentru text cu PyTorch
Shubham Jain
Instructor
Ce sunt atacurile adversariale?
Modificări ale datelor de intrare
Nu aleatorii, ci modificări malițioase calculate
Pot afecta drastic procesul decizional al IA
Importanța robusteții
Sisteme IA care determină dacă comentariile utilizatorilor sunt toxice sau benigne
IA care amplifică neintenționat stereotipuri negative din date părtinite
IA care furnizează informații înșelătoare
Metoda semnului gradientului rapid (FGSM)
Exploatează informațiile de învățare ale modelului
Realizează cea mai mică modificare posibilă pentru a înșela modelul
Coborârea proiectată a gradientului (PGD)
Mai avansat decât FGSM: este iterativ
Caută perturbarea cea mai eficientă
Atacul Carlini & Wagner (C&W)
Se concentrează pe optimizarea funcției de pierdere
Nu doar înșelăciune, ci și nedetectabilitate
Construirea apărărilor: strategii
Ansamblu de modele:
Utilizarea mai multor modele
Augmentare robustă a datelor:
Augmentarea datelor
Antrenament adversarial:
Anticiparea înșelăciunii
Construirea apărărilor: instrumente și tehnici
Setul de instrumente de robustețe PyTorch:
Consolidarea modelelor de text
Mascarea gradientului:
Adăugarea varietății în datele de antrenament pentru a ascunde tipare exploatabile
Tehnici de regularizare:
Asigurarea echilibrului modelului
1
https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Să exersăm!
Deep Learning pentru text cu PyTorch
Preparing Video For Download...