Tấn công đối kháng vào mô hình phân loại văn bản

Deep Learning cho Văn bản với PyTorch

Shubham Jain

Instructor

Tấn công đối kháng là gì?

  • Chỉnh nhỏ ở dữ liệu đầu vào
  • Không ngẫu nhiên mà là thay đổi ác ý có tính toán
  • Có thể làm sai lệch mạnh quyết định của AI
Deep Learning cho Văn bản với PyTorch

Tầm quan trọng của độ bền vững

  • Hệ AI phân loại bình luận độc hại hay an toàn
  • AI vô tình khuếch đại định kiến do dữ liệu thiên lệch
  • AI cung cấp thông tin gây hiểu lầm
Deep Learning cho Văn bản với PyTorch

Phương pháp dấu hiệu gradient nhanh (FGSM)

  • Khai thác thông tin đã học của mô hình
  • Tạo thay đổi nhỏ nhất để đánh lừa mô hình

Tấn công FGSM

Deep Learning cho Văn bản với PyTorch

Gradient chiếu theo hạ dốc (PGD)

  • Nâng cao hơn FGSM: lặp nhiều bước
  • Tìm nhiễu hiệu quả nhất

Tấn công PGD

Deep Learning cho Văn bản với PyTorch

Tấn công Carlini & Wagner (C&W)

  • Tập trung tối ưu hàm mất mát
  • Không chỉ đánh lừa mà còn khó bị phát hiện

Tấn công C&W

Deep Learning cho Văn bản với PyTorch

Xây dựng phòng thủ: chiến lược

  • Tập hợp mô hình:
    • Dùng nhiều mô hình

 

  • Tăng cường dữ liệu bền vững:
    • Tăng cường dữ liệu

 

  • Huấn luyện đối kháng:
    • Dự liệu và vô hiệu lừa đảo

Tập hợp mô hình

Deep Learning cho Văn bản với PyTorch

Xây dựng phòng thủ: công cụ & kỹ thuật

  • Robustness Toolbox của PyTorch:
    • Tăng cường mô hình văn bản

 

  • Che giấu gradient:
    • Đa dạng hóa dữ liệu huấn luyện để che mẫu có thể khai thác

 

  • Các kỹ thuật regularization:
    • Giữ cân bằng mô hình

Python Robustness toolbox

Che giấu gradient

Kỹ thuật regularization

1 https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Deep Learning cho Văn bản với PyTorch

Luyện tập nhé!

Deep Learning cho Văn bản với PyTorch

Preparing Video For Download...