Attaques adversariales sur les modèles de classification de texte
Apprentissage profond pour le texte avec PyTorch
Shubham Jain
Instructor
Qu'est-ce qu'une attaque adversariale ?
Ajustements aux données d'entrée
Modifications malicieuses calculées, non aléatoires
Peuvent fortement influencer la prise de décision de l'IA
Importance de la robustesse
Systèmes d'IA qui jugent des commentaires comme toxiques ou bénins
IA qui amplifie involontairement des stéréotypes dus à des données biaisées
IA qui fournit de l'information trompeuse
Méthode FGSM (Fast Gradient Sign Method)
Exploite ce que le modèle a appris
Apporte le plus petit changement possible pour le tromper
Descente de gradient projetée (PGD)
Plus avancée que FGSM : itérative
Cherche la perturbation la plus efficace
Attaque de Carlini et Wagner (C&W)
Vise l'optimisation de la fonction de perte
Pas seulement tromper, mais rester indétectable
Mettre en place des défenses : stratégies
Assemblage de modèles :
Utiliser plusieurs modèles
Augmentation robuste des données :
Augmenter les données
Apprentissage adversarial :
Anticiper les tentatives de tromperie
Mettre en place des défenses : outils et techniques
Robustness Toolbox de PyTorch :
Renforcer les modèles de texte
Masquage de gradient :
Diversifier les données d'entraînement pour cacher les schémas exploitables
Techniques de régularisation :
Assurer l'équilibre du modèle
1
https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Passons à la pratique !
Apprentissage profond pour le texte avec PyTorch
Preparing Video For Download...