Adversariella attacker mot textklassificeringsmodeller
Djupinlärning för text med PyTorch
Shubham Jain
Instructor
Vad är adversariella attacker?
Ändringar i indata
Inte slumpmässiga utan beräknade skadliga förändringar
Kan påverka AI:ns beslutsfattande drastiskt
Varför robusthet är viktigt
AI-system som bedömer om användarkommentarer är toxiska eller ofarliga
AI som oavsiktligt förstärker negativa stereotyper från partisk data
AI som ger vilseledande information
Fast Gradient Sign Method (FGSM)
Utnyttjar modellens inlärningsinformation
Gör den minsta möjliga förändring för att lura modellen
Projected Gradient Descent (PGD)
Mer avancerad än FGSM: iterativ metod
Söker efter den mest effektiva störningen
Carlini & Wagner-attacken (C&W)
Fokuserar på att optimera förlustfunktionen
Handlar inte bara om att lura utan om att vara oupptäckbar
Bygga försvar: strategier
Modelensembling:
Använd flera modeller
Robust dataaugmentering:
Dataaugmentering
Adversariell träning:
Förutse manipulation
Bygga försvar: verktyg och tekniker
PyTorchs Robustness Toolbox:
Förstärk textmodeller
Gradientmaskering:
Lägg till variation i träningsdata för att dölja exploaterbara mönster
Regulariseringstekniker:
Säkerställ modellbalans
1
https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Nu kör vi en övning!
Djupinlärning för text med PyTorch
Preparing Video For Download...