การ Fine-tuning ขั้นสูง

แนวคิดของ Large Language Models (LLMs)

Vidhi Chugh

AI strategist and ethicist

ตอนนี้อยู่ที่ไหน?

ภาพแสดงความคืบหน้าที่ขั้นตอน Advanced fine-tuning

แนวคิดของ Large Language Models (LLMs)

Reinforcement Learning through Human Feedback

 

  • Pre-training

 

  • Fine-tuning

 

  • Reinforcement Learning through Human Feedback (RLHF)

 

ภาพประกอบของคนสี่คนที่ให้ feedback เชิงบวกด้วยอิโมจิและดาว

แนวคิดของ Large Language Models (LLMs)

Pre-training

  • ข้อมูลข้อความจำนวนมาก:
    • เว็บไซต์ หนังสือ และบทความ
    • สถาปัตยกรรม Transformer
    • เรียนรู้รูปแบบภาษา ไวยากรณ์ และข้อเท็จจริงทั่วไป

 

  • การทำนายคำถัดไป
  • Masked language modeling

กระบวนการ Pre-training สำหรับสร้าง LLM

1 Freepik
แนวคิดของ Large Language Models (LLMs)

Fine-tuning

 

  • N-shot training

 

  • ชุดข้อมูลที่มีป้ายกำกับขนาดเล็กสำหรับงานที่เกี่ยวข้อง

กระบวนการ Fine-tuning

แนวคิดของ Large Language Models (LLMs)

แล้วทำไมต้องใช้ RLHF?

  • ข้อมูลฝึกสอนทั่วไปมีคุณภาพต่ำ
    • สัญญาณรบกวน
    • ข้อผิดพลาด
    • ความไม่สอดคล้อง
    • ความแม่นยำลดลง

ตัวอย่างความแม่นยำที่ลดลง:

  • ฝึกด้วยข้อมูลจากฟอรัมออนไลน์
  • ความคิดเห็นและข้อเท็จจริงที่ไม่ผ่านการตรวจสอบ
  • ต้องการการตรวจสอบจากผู้เชี่ยวชาญภายนอก

 

เป้าธนูที่มีลูกธนูพลาดเป้าหมาย

แนวคิดของ Large Language Models (LLMs)

จุดเริ่มต้นของความต้องการ Fine-tune

  • Pre-training
    • เรียนรู้รูปแบบภาษาพื้นฐาน
    • ไม่ครอบคลุมความซับซ้อนเฉพาะบริบท

 

  • Fine-tuning
    • ข้อมูลที่มีป้ายกำกับคุณภาพสูงช่วยเพิ่มประสิทธิภาพ

 

  • RLHF เข้ามาช่วย!
    • Human feedback
แนวคิดของ Large Language Models (LLMs)

ทำความเข้าใจ RLHF อย่างง่าย

 

  • ผลลัพธ์ของโมเดลถูกตรวจสอบโดยมนุษย์
  • อัปเดตโมเดลตาม feedback ที่ได้รับ

 

  • ขั้นตอนที่ 1:
    • รับ prompt
    • สร้างคำตอบหลายรายการ

 

 

LLM รับ prompt และสร้างคำตอบ

แนวคิดของ Large Language Models (LLMs)

ผู้เชี่ยวชาญเข้ามามีบทบาท

 

  • ขั้นตอนที่ 2:
    • ผู้เชี่ยวชาญตรวจสอบคำตอบเหล่านี้
    • จัดอันดับคำตอบตามคุณภาพ
      • ความแม่นยำ
      • ความเกี่ยวข้อง
      • ความสอดคล้อง

การเพิ่มการตรวจสอบโดยมนุษย์ต่อคำตอบของ LLM

แนวคิดของ Large Language Models (LLMs)

ถึงเวลารับ feedback

  • ขั้นตอนที่ 3:
    • เรียนรู้จากการจัดอันดับของผู้เชี่ยวชาญ
    • เพื่อปรับคำตอบให้สอดคล้องกับความต้องการในอนาคต

 

  • และดำเนินต่อไปเรื่อย ๆ!
    • สร้างคำตอบต่อไป
    • รับการจัดอันดับจากผู้เชี่ยวชาญ
    • ปรับปรุงการเรียนรู้

 

 

Human response ถูกป้อนกลับเข้าสู่ LLM

แนวคิดของ Large Language Models (LLMs)

สรุป

  • Pre-training เพื่อเรียนรู้ความรู้ด้านภาษาทั่วไป

 

  • Fine-tuning สำหรับงานเฉพาะด้าน

 

  • เทคนิค RLHF เพื่อเสริม Fine-tuning ด้วย Human feedback

 

  • การผสมผสานนี้มีประสิทธิภาพสูงมาก!
แนวคิดของ Large Language Models (LLMs)

ครบวงจร LLM

กระบวนการฝึก LLM ทั้งหมด

แนวคิดของ Large Language Models (LLMs)

มาฝึกกันเถอะ!

แนวคิดของ Large Language Models (LLMs)

Preparing Video For Download...