Ajustare avansată

Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Vidhi Chugh

AI strategist and ethicist

Unde ne aflăm?

Imagine de progres care indică etapa de ajustare avansată

Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Învățare prin întărire cu feedback uman

 

  • Pre-antrenament

 

  • Ajustare fină

 

  • Învățare prin întărire cu feedback uman (RLHF)

 

Ilustrație cu patru persoane care oferă feedback pozitiv prin emoji-uri și stele.

Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Pre-antrenament

  • Volume mari de date text:
    • Site-uri web, cărți și articole
    • Arhitectură Transformer
    • Învață tipare lingvistice, gramatică și fapte

 

  • Predicția cuvântului următor
  • Modelare limbaj cu mascarea cuvintelor

Procesul de pre-antrenare pentru construirea LLM-urilor

1 Freepik
Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Ajustare fină

 

  • Antrenament N-shot

 

  • Set mic de date etichetate pentru o sarcină similară

Procesul de ajustare fină

Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

De ce RLHF?

  • Datele de antrenament generale sunt de calitate slabă
    • Zgomot
    • Erori
    • Inconsistențe
    • Acuratețe redusă

Exemplu de acuratețe redusă:

  • Antrenat pe date din forumuri online
  • Opinii și fapte nevalidate
  • Necesită validare externă de experți

 

Țintă de tir cu arcul cu săgeți care au ratat centrul

Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Nevoia de ajustare fină

  • Pre-antrenament
    • Învață tipare lingvistice generale
    • Nu surprinde complexitățile contextuale

 

  • Ajustare fină
    • Datele etichetate de calitate îmbunătățesc performanța

 

  • Intră RLHF!
    • Feedback uman
Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Simplificarea RLHF

 

  • Răspunsul modelului este revizuit de un om
  • Modelul se actualizează pe baza feedback-ului

 

  • Pasul 1:
    • Primește un prompt
    • Generează mai multe răspunsuri

 

 

Un LLM care procesează un prompt și generează un răspuns

Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Intervine expertul uman

 

  • Pasul 2:
    • Un expert verifică răspunsurile
    • Ordonează răspunsurile după calitate
      • Acuratețe
      • Relevanță
      • Coerență

Adăugarea verificării umane la răspunsurile LLM

Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Momentul feedback-ului

  • Pasul 3:
    • Învață din clasificarea expertului
    • Aliniază răspunsurile viitoare la preferințele acestuia

 

  • Procesul continuă!
    • Generează în continuare răspunsuri
    • Primește clasificările expertului
    • Ajustează procesul de învățare

 

 

Feedback-ul uman este transmis înapoi către LLM

Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Recapitulare

  • Pre-antrenament pentru cunoștințe lingvistice generale

 

  • Ajustare fină pentru sarcini specifice

 

  • Tehnici RLHF pentru îmbunătățirea ajustării fine prin feedback uman

 

  • Combinația este foarte eficientă!
Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Finalizarea LLM

Procesul complet de antrenare a unui LLM

Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Let's practice!

Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Preparing Video For Download...