ส่วนประกอบพื้นฐานในการเทรน LLM

แนวคิดของ Large Language Models (LLMs)

Vidhi Chugh

AI strategist and ethicist

ตอนนี้อยู่ที่ไหน?

ภาพแสดงความก้าวหน้าในการเรียนรู้ในขั้นตอน Pre-training

แนวคิดของ Large Language Models (LLMs)

Generative pre-training

 

  • เทรนด้วย generative pre-training

    • ข้อมูลนำเข้าเป็น text token
    • เทรนให้ทำนาย token ในชุดข้อมูล

 

  • ประเภท:
    • การทำนายคำถัดไป
    • Masked language modeling
แนวคิดของ Large Language Models (LLMs)

การทำนายคำถัดไป

  • เทคนิค supervised learning
    • โมเดลเทรนบนคู่ input-output

 

  • ทำนายคำถัดไปและสร้างข้อความที่ต่อเนื่องกัน
  • จับความสัมพันธ์ระหว่างคำ

 

  • ข้อมูลสำหรับเทรน
    • คู่ตัวอย่าง input และ output

การแนะนำอัตโนมัติโดย search engine

แนวคิดของ Large Language Models (LLMs)

ข้อมูลเทรนสำหรับการทำนายคำถัดไป

Input

The quick brown

The quick brown fox

The quick brown fox jumps

The quick brown fox jumps over

The quick brown fox jumps over the

The quick brown fox jumps over the lazy

The quick brown fox jumps over the lazy dog.

Output

fox

jumps

over

the

lazy

dog

แนวคิดของ Large Language Models (LLMs)

คำใดเชื่อมโยงกับ pizza มากกว่ากัน?

 

  • ตัวอย่างมากขึ้น = ทำนายได้แม่นยำขึ้น

 

  • ตัวอย่าง:
    • I love to eat pizza with _ _ _ _ _ _

 

  • cheese มีความเชื่อมโยงกับ pizza มากกว่าคำอื่น

ความน่าจะเป็นของคำต่าง ๆ ที่เชื่อมโยงกับคำว่า "Pizza"

แนวคิดของ Large Language Models (LLMs)

Masked language modeling

  • ซ่อนคำที่เลือกไว้

  • โมเดลที่เทรนแล้วทำนายคำที่ถูกซ่อน

 

  • ข้อความต้นฉบับ: "The quick brown fox jumps over the lazy dog."

  • ข้อความที่ถูกซ่อน: "The quick [MASK] fox jumps over the lazy dog."

 

  • เป้าหมาย: ทำนายคำที่หายไป

  • อ้างอิงจากสิ่งที่เรียนรู้จากข้อมูลเทรน

แนวคิดของ Large Language Models (LLMs)

มาฝึกกันเถอะ!

แนวคิดของ Large Language Models (LLMs)

Preparing Video For Download...