텍스트 분류 모델에 대한 적대적 공격

PyTorch로 배우는 텍스트 딥러닝

Shubham Jain

Instructor

적대적 공격이란?

  • 입력 데이터 미세 조정
  • 무작위가 아닌 계산된 악의적 변경
  • AI 의사결정에 큰 영향 가능
PyTorch로 배우는 텍스트 딥러닝

강건성의 중요성

  • 사용자 댓글을 유해/무해로 분류
  • 편향 데이터로 부정적 고정관념을 확대
  • 오해를 부르는 정보 제공
PyTorch로 배우는 텍스트 딥러닝

Fast Gradient Sign Method (FGSM)

  • 모델의 학습 정보를 악용
  • 속이기 위해 가능한 최소 변경 수행

FGSM 공격

PyTorch로 배우는 텍스트 딥러닝

Projected Gradient Descent (PGD)

  • FGSM보다 고급: 반복적 수행
  • 가장 효과적인 교란을 탐색

PGD 공격

PyTorch로 배우는 텍스트 딥러닝

Carlini & Wagner (C&W) 공격

  • 손실 함수를 최적화에 집중
  • 단순 속임수를 넘어 탐지 회피 지향

C&W 공격

PyTorch로 배우는 텍스트 딥러닝

방어 구축: 전략

  • 모델 앙상블:
    • 여러 모델 활용

 

  • 강건한 데이터 증강:
    • 데이터 증강

 

  • 적대적 학습:
    • 기만 시도 대비

모델 앙상블

PyTorch로 배우는 텍스트 딥러닝

방어 구축: 도구와 기법

  • PyTorch Robustness Toolbox:
    • 텍스트 모델 강화

 

  • 그래디언트 마스킹:
    • 학습 데이터에 다양성 추가로 취약 패턴 은닉

 

  • 정규화 기법:
    • 모델 균형 확보

Python Robustness toolbox

그래디언트 마스킹

정규화 기법

1 https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
PyTorch로 배우는 텍스트 딥러닝

연습해 봅시다!

PyTorch로 배우는 텍스트 딥러닝

Preparing Video For Download...