Adversariella attacker mot textklassificeringsmodeller

Djupinlärning för text med PyTorch

Shubham Jain

Instructor

Vad är adversariella attacker?

  • Ändringar i indata
  • Inte slumpmässiga utan beräknade skadliga förändringar
  • Kan påverka AI:ns beslutsfattande drastiskt
Djupinlärning för text med PyTorch

Varför robusthet är viktigt

  • AI-system som bedömer om användarkommentarer är toxiska eller ofarliga
  • AI som oavsiktligt förstärker negativa stereotyper från partisk data
  • AI som ger vilseledande information
Djupinlärning för text med PyTorch

Fast Gradient Sign Method (FGSM)

  • Utnyttjar modellens inlärningsinformation
  • Gör den minsta möjliga förändring för att lura modellen

FGSM-attack

Djupinlärning för text med PyTorch

Projected Gradient Descent (PGD)

  • Mer avancerad än FGSM: iterativ metod
  • Söker efter den mest effektiva störningen

PGD-attack

Djupinlärning för text med PyTorch

Carlini & Wagner-attacken (C&W)

  • Fokuserar på att optimera förlustfunktionen
  • Handlar inte bara om att lura utan om att vara oupptäckbar

C&W-attack

Djupinlärning för text med PyTorch

Bygga försvar: strategier

  • Modelensembling:
    • Använd flera modeller

 

  • Robust dataaugmentering:
    • Dataaugmentering

 

  • Adversariell träning:
    • Förutse manipulation

Modelensembling

Djupinlärning för text med PyTorch

Bygga försvar: verktyg och tekniker

  • PyTorchs Robustness Toolbox:
    • Förstärk textmodeller

 

  • Gradientmaskering:
    • Lägg till variation i träningsdata för att dölja exploaterbara mönster

 

  • Regulariseringstekniker:
    • Säkerställ modellbalans

Python Robustness toolbox

Gradientmaskering

Regulariseringstekniker

1 https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Djupinlärning för text med PyTorch

Nu kör vi en övning!

Djupinlärning för text med PyTorch

Preparing Video For Download...