Tấn công đối kháng vào mô hình phân loại văn bản
Deep Learning cho Văn bản với PyTorch
Shubham Jain
Instructor
Tấn công đối kháng là gì?
Chỉnh nhỏ ở dữ liệu đầu vào
Không ngẫu nhiên mà là thay đổi ác ý có tính toán
Có thể làm sai lệch mạnh quyết định của AI
Tầm quan trọng của độ bền vững
Hệ AI phân loại bình luận độc hại hay an toàn
AI vô tình khuếch đại định kiến do dữ liệu thiên lệch
AI cung cấp thông tin gây hiểu lầm
Phương pháp dấu hiệu gradient nhanh (FGSM)
Khai thác thông tin đã học của mô hình
Tạo thay đổi nhỏ nhất để đánh lừa mô hình
Gradient chiếu theo hạ dốc (PGD)
Nâng cao hơn FGSM: lặp nhiều bước
Tìm nhiễu hiệu quả nhất
Tấn công Carlini & Wagner (C&W)
Tập trung tối ưu hàm mất mát
Không chỉ đánh lừa mà còn khó bị phát hiện
Xây dựng phòng thủ: chiến lược
Tập hợp mô hình:
Dùng nhiều mô hình
Tăng cường dữ liệu bền vững:
Tăng cường dữ liệu
Huấn luyện đối kháng:
Dự liệu và vô hiệu lừa đảo
Xây dựng phòng thủ: công cụ & kỹ thuật
Robustness Toolbox của PyTorch:
Tăng cường mô hình văn bản
Che giấu gradient:
Đa dạng hóa dữ liệu huấn luyện để che mẫu có thể khai thác
Các kỹ thuật regularization:
Giữ cân bằng mô hình
1
https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Luyện tập nhé!
Deep Learning cho Văn bản với PyTorch
Preparing Video For Download...