Fine-tuning

แนวคิดของ Large Language Models (LLMs)

Vidhi Chugh

AI strategist and ethicist

ตอนนี้อยู่ที่ไหน?

แผนภูมิความก้าวหน้าแสดงว่าถึงขั้นตอน fine-tuning แล้ว

แนวคิดของ Large Language Models (LLMs)

 

  • Pre-training

ภาพเด็กนักเรียนเป็นอุปมาของ pre-training

          การศึกษาในโรงเรียน

 

  • Fine-tuning

ภาพนักศึกษามหาวิทยาลัยเป็นอุปมาของ fine-tuning

        การเชี่ยวชาญในมหาวิทยาลัย
1 Freepik
แนวคิดของ Large Language Models (LLMs)

ความท้าทายของความ "ใหญ่"

  • Fine-tuning ช่วยได้
  • คอมพิวเตอร์ประสิทธิภาพสูง
  • วิธีการเทรนโมเดลอย่างมีประสิทธิภาพ
  • ข้อมูลเทรนจำนวนมาก

ภาพแสดงความพร้อมของข้อมูล เวลาเทรน และพลังการประมวลผลในฐานะความท้าทายของการสร้าง LLM

แนวคิดของ Large Language Models (LLMs)

พลังการประมวลผล

  • หน่วยความจำ

  • พลังการประมวลผล

  • โครงสร้างพื้นฐาน

  • มีค่าใช้จ่ายสูง

  • LLM:
    • CPU หลายแสนตัว
    • GPU หลายหมื่นตัว
  • คอมพิวเตอร์ส่วนตัว: CPU 4-8 ตัว และ GPU 1-2 ตัว

ชายทำงานบนคอมพิวเตอร์ที่เชื่อมต่อกับเซิร์ฟเวอร์ขนาดใหญ่

1 Freepik
แนวคิดของ Large Language Models (LLMs)

การเทรนโมเดลอย่างมีประสิทธิภาพ

ภาพประกอบแทนโมเดล deep learning

  • เวลาเทรนสูงมาก

 

  • อาจใช้เวลาหลายสัปดาห์หรือเป็นเดือน

 

  • การเทรนโมเดลอย่างมีประสิทธิภาพ = ลดเวลาเทรน

 

  • เวลาประมวลผล 355 ปีบน GPU เดียว
แนวคิดของ Large Language Models (LLMs)

ความพร้อมของข้อมูล

 

  • ต้องการข้อมูลคุณภาพสูง
  • เพื่อเรียนรู้ความซับซ้อนและความละเอียดอ่อนของภาษา
  • ข้อมูลข้อความขนาดไม่กี่ร้อยกิกะไบต์ (GB)

    • มากกว่าหนังสือหนึ่งล้านเล่ม
  • ข้อมูลจำนวนมหาศาล

  ภาพแฟ้มเอกสารสองกองที่เต็มล้นเพื่อสื่อถึงข้อมูลขนาดใหญ่

แนวคิดของ Large Language Models (LLMs)

การฟันฝ่าความท้าทาย

  • Fine-tuning
    • แก้ปัญหาความท้าทายเหล่านี้บางส่วน
    • ปรับโมเดลที่ผ่านการ pre-train มาแล้ว

 

  • โมเดลที่ผ่าน pre-training
    • เรียนรู้จากชุดข้อมูลทั่วไป
    • ยังไม่ได้ปรับให้เหมาะกับงานเฉพาะทาง
    • สามารถทำ fine-tuning สำหรับปัญหาเฉพาะได้

ภาพคนทำงานบนแล็ปท็อปขนาดใหญ่พร้อมเครื่องมือและเฟืองเพื่อสื่อถึง fine-tuning

แนวคิดของ Large Language Models (LLMs)

Fine-tuning vs. Pre-training

  • Fine-tuning

  • การประมวลผล

    • CPU และ GPU 1-2 ตัว

 

  • เวลาเทรน
    • ชั่วโมงถึงไม่กี่วัน

 

  • ข้อมูล
    • ~1 กิกะไบต์
  • Pre-training

  • การประมวลผล

    • CPU และ GPU หลายพัน

 

  • เวลาเทรน
    • สัปดาห์ถึงเป็นเดือน

 

  • ข้อมูล
    • หลายร้อยกิกะไบต์
แนวคิดของ Large Language Models (LLMs)

มาฝึกกันเถอะ!

แนวคิดของ Large Language Models (LLMs)

Preparing Video For Download...