텍스트 분류 모델에 대한 적대적 공격
PyTorch로 배우는 텍스트 딥러닝
Shubham Jain
Instructor
적대적 공격이란?
입력 데이터 미세 조정
무작위가 아닌 계산된 악의적 변경
AI 의사결정에 큰 영향 가능
강건성의 중요성
사용자 댓글을 유해/무해로 분류
편향 데이터로 부정적 고정관념을 확대
오해를 부르는 정보 제공
Fast Gradient Sign Method (FGSM)
모델의 학습 정보를 악용
속이기 위해 가능한 최소 변경 수행
Projected Gradient Descent (PGD)
FGSM보다 고급: 반복적 수행
가장 효과적인 교란을 탐색
Carlini & Wagner (C&W) 공격
손실 함수를 최적화에 집중
단순 속임수를 넘어 탐지 회피 지향
방어 구축: 전략
모델 앙상블:
여러 모델 활용
강건한 데이터 증강:
데이터 증강
적대적 학습:
기만 시도 대비
방어 구축: 도구와 기법
PyTorch Robustness Toolbox:
텍스트 모델 강화
그래디언트 마스킹:
학습 데이터에 다양성 추가로 취약 패턴 은닉
정규화 기법:
모델 균형 확보
1
https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
연습해 봅시다!
PyTorch로 배우는 텍스트 딥러닝
Preparing Video For Download...