Avancerad finjustering

Koncept inom stora språkmodeller (LLM)

Vidhi Chugh

AI strategist and ethicist

Var befinner vi oss?

Framstegsvy som visar att vi befinner oss i steget Avancerad finjustering

Koncept inom stora språkmodeller (LLM)

Förstärkningsinlärning med mänsklig återkoppling

 

  • Förträning

 

  • Finjustering

 

  • Förstärkningsinlärning med mänsklig återkoppling (RLHF)

 

Illustration av fyra personer som ger positiv återkoppling med emojis och stjärnor.

Koncept inom stora språkmodeller (LLM)

Förträning

  • Stora mängder textdata:
    • Webbplatser, böcker och artiklar
    • Transformerarkitektur
    • Lär sig allmänna språkmönster, grammatik och fakta

 

  • Nästa-ord-prediktion
  • Maskerad språkmodellering

Förträningsprocess för att bygga LLM:er

1 Freepik
Koncept inom stora språkmodeller (LLM)

Finjustering

 

  • N-shot-träning

 

  • Litet märkt dataset för relaterad uppgift

Finjusteringsprocess

Koncept inom stora språkmodeller (LLM)

Men varför RLHF?

  • Generella träningsdata håller låg kvalitet
    • Brus
    • Fel
    • Inkonsekvenser
    • Sänkt noggrannhet

Exempel på sänkt noggrannhet:

  • Tränad på data från diskussionsforum
  • Overifierade åsikter och fakta
  • Kräver extern expertvalidering

 

Piltavla där pilarna missat mitten

Koncept inom stora språkmodeller (LLM)

Behovet av finjustering

  • Förträning
    • Lär sig underliggande språkmönster
    • Fångar inte kontextspecifik komplexitet

 

  • Finjustering
    • Märkt kvalitetsdata förbättrar prestandan

 

  • Här kommer RLHF!
    • Mänsklig återkoppling
Koncept inom stora språkmodeller (LLM)

RLHF förenklat

 

  • Modellens utdata granskas av människa
  • Modellen uppdateras utifrån återkopplingen

 

  • Steg 1:
    • Tar emot en prompt
    • Genererar flera svar

 

 

En LLM som tar emot en prompt och genererar ett svar

Koncept inom stora språkmodeller (LLM)

Den mänskliga experten kliver in

 

  • Steg 2:
    • En mänsklig expert granskar svaren
    • Rangordnar svaren efter kvalitet
      • Noggrannhet
      • Relevans
      • Koherens

Mänsklig verifiering av LLM:ens svar

Koncept inom stora språkmodeller (LLM)

Dags för återkoppling

  • Steg 3:
    • Lär sig av expertens rangordning
    • Anpassar framtida svar efter expertens preferenser

 

  • Processen fortsätter!
    • Fortsätter generera svar
    • Tar emot expertens rangordningar
    • Justerar inlärningen

 

 

Mänsklig återkoppling matas tillbaka till LLM:en

Koncept inom stora språkmodeller (LLM)

Sammanfattning

  • Förträning för allmän språkkunskap

 

  • Finjustering för specifika uppgifter

 

  • RLHF för att förstärka finjustering med mänsklig återkoppling

 

  • Kombinationen är mycket effektiv!
Koncept inom stora språkmodeller (LLM)

LLM:en är komplett

Den fullständiga träningsprocessen för LLM:er

Koncept inom stora språkmodeller (LLM)

Nu kör vi en övning!

Koncept inom stora språkmodeller (LLM)

Preparing Video For Download...