Ataki adwersaryjne na modele klasyfikacji tekstu
Uczenie głębokie dla tekstu z PyTorch
Shubham Jain
Instructor
Czym są ataki adwersaryjne?
Modyfikacje danych wejściowych
Nie losowe, lecz celowo złośliwe zmiany
Mogą znacząco wpłynąć na decyzje modelu AI
Znaczenie odporności modeli
Systemy AI oceniające, czy komentarze użytkowników są toksyczne
AI nieumyślnie wzmacniająca negatywne stereotypy ze stronniczych danych
AI podająca mylące informacje
Fast Gradient Sign Method (FGSM)
Wykorzystuje informacje o uczeniu modelu
Wprowadza jak najmniejszą zmianę, aby oszukać model
Projected Gradient Descent (PGD)
Bardziej zaawansowany niż FGSM: jest iteracyjny
Szuka najbardziej skutecznego zakłócenia
Atak Carlini & Wagner (C&W)
Koncentruje się na optymalizacji funkcji straty
Chodzi nie tylko o oszustwo, ale i o niewykrywalność
Budowanie ochrony: strategie
Ensembling modeli:
Użycie wielu modeli
Solidna augmentacja danych:
Augmentacja danych
Trening adwersaryjny:
Antycypowanie oszustwa
Budowanie ochrony: narzędzia i techniki
PyTorch Robustness Toolbox:
Wzmacnianie modeli tekstowych
Maskowanie gradientu:
Urozmaicenie danych treningowych w celu ukrycia exploitowalnych wzorców
Techniki regularyzacji:
Zapewnienie równowagi modelu
1
https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Czas na ćwiczenia!
Uczenie głębokie dla tekstu z PyTorch
Preparing Video For Download...