การโจมตีแบบ Adversarial บนโมเดลจำแนกข้อความ

Deep Learning สำหรับข้อความด้วย PyTorch

Shubham Jain

Instructor

Adversarial attacks คืออะไร?

  • การปรับแต่งข้อมูล input
  • ไม่ใช่การเปลี่ยนแปลงแบบสุ่ม แต่คำนวณมาอย่างแม่นยำ
  • ส่งผลอย่างมากต่อการตัดสินใจของ AI
Deep Learning สำหรับข้อความด้วย PyTorch

ความสำคัญของความทนทาน

  • ระบบ AI ตัดสินว่าความคิดเห็นของผู้ใช้เป็นอันตรายหรือไม่
  • AI ขยายอคติเชิงลบโดยไม่ตั้งใจจากข้อมูลที่มีอคติ
  • AI ให้ข้อมูลที่ทำให้เกิดความเข้าใจผิด
Deep Learning สำหรับข้อความด้วย PyTorch

Fast Gradient Sign Method (FGSM)

  • ใช้ประโยชน์จากข้อมูลการเรียนรู้ของโมเดล
  • เปลี่ยนแปลงข้อมูลน้อยที่สุดเท่าที่จะหลอกโมเดลได้

การโจมตีแบบ FGSM

Deep Learning สำหรับข้อความด้วย PyTorch

Projected Gradient Descent (PGD)

  • ซับซ้อนกว่า FGSM: ทำงานแบบวนซ้ำ
  • ค้นหาการรบกวนที่มีประสิทธิภาพมากที่สุด

การโจมตีแบบ PGD

Deep Learning สำหรับข้อความด้วย PyTorch

การโจมตีแบบ Carlini & Wagner (C&W)

  • มุ่งเน้นการปรับ loss function ให้เหมาะสมที่สุด
  • ไม่เพียงแค่หลอกโมเดล แต่ยังซ่อนตัวไม่ให้ตรวจจับได้

การโจมตีแบบ C&W

Deep Learning สำหรับข้อความด้วย PyTorch

การสร้างการป้องกัน: กลยุทธ์

  • Model Ensembling:
    • ใช้หลายโมเดลร่วมกัน

 

  • Robust Data Augmentation:
    • เพิ่มความหลากหลายของข้อมูล

 

  • Adversarial Training:
    • เตรียมรับมือกับการหลอกลวง

Model Ensembling

Deep Learning สำหรับข้อความด้วย PyTorch

การสร้างการป้องกัน: เครื่องมือและเทคนิค

  • PyTorch's Robustness Toolbox:
    • เสริมความแข็งแกร่งให้โมเดลข้อความ

 

  • Gradient Masking:
    • เพิ่มความหลากหลายในข้อมูลฝึกเพื่อซ่อนรูปแบบที่ถูกโจมตีได้

 

  • Regularization Techniques:
    • รักษาสมดุลของโมเดล

Python Robustness toolbox

Gradient Masking

Regularization Techniques

1 https://adversarial-robustness-toolbox.readthedocs.io/en/latest/, https://stock.adobe.com/ie/contributor/209161356/designer-s-circle
Deep Learning สำหรับข้อความด้วย PyTorch

มาฝึกกันเถอะ!

Deep Learning สำหรับข้อความด้วย PyTorch

Preparing Video For Download...