การโจมตีแบบ Adversarial บนโมเดลจำแนกข้อความ
Deep Learning สำหรับข้อความด้วย PyTorch
Shubham Jain
Instructor
Adversarial attacks คืออะไร?
การปรับแต่งข้อมูล input
ไม่ใช่การเปลี่ยนแปลงแบบสุ่ม แต่คำนวณมาอย่างแม่นยำ
ส่งผลอย่างมากต่อการตัดสินใจของ AI
ความสำคัญของความทนทาน
ระบบ AI ตัดสินว่าความคิดเห็นของผู้ใช้เป็นอันตรายหรือไม่
AI ขยายอคติเชิงลบโดยไม่ตั้งใจจากข้อมูลที่มีอคติ
AI ให้ข้อมูลที่ทำให้เกิดความเข้าใจผิด
Fast Gradient Sign Method (FGSM)
ใช้ประโยชน์จากข้อมูลการเรียนรู้ของโมเดล
เปลี่ยนแปลงข้อมูลน้อยที่สุดเท่าที่จะหลอกโมเดลได้
Projected Gradient Descent (PGD)
ซับซ้อนกว่า FGSM: ทำงานแบบวนซ้ำ
ค้นหาการรบกวนที่มีประสิทธิภาพมากที่สุด
การโจมตีแบบ Carlini & Wagner (C&W)
มุ่งเน้นการปรับ loss function ให้เหมาะสมที่สุด
ไม่เพียงแค่หลอกโมเดล แต่ยังซ่อนตัวไม่ให้ตรวจจับได้
การสร้างการป้องกัน: กลยุทธ์
Model Ensembling:
ใช้หลายโมเดลร่วมกัน
Robust Data Augmentation:
เพิ่มความหลากหลายของข้อมูล
Adversarial Training:
เตรียมรับมือกับการหลอกลวง
การสร้างการป้องกัน: เครื่องมือและเทคนิค
PyTorch's Robustness Toolbox:
เสริมความแข็งแกร่งให้โมเดลข้อความ
Gradient Masking:
เพิ่มความหลากหลายในข้อมูลฝึกเพื่อซ่อนรูปแบบที่ถูกโจมตีได้
Regularization Techniques:
รักษาสมดุลของโมเดล
1
https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
มาฝึกกันเถอะ!
Deep Learning สำหรับข้อความด้วย PyTorch
Preparing Video For Download...