Byggstenar för att träna LLM:er

Koncept inom stora språkmodeller (LLM)

Vidhi Chugh

AI strategist and ethicist

Var befinner vi oss?

Bild som visar inlärningsframsteg som förträning

Koncept inom stora språkmodeller (LLM)

Generativ förträning

 

  • Tränas med generativ förträning

    • Indata i form av texttokens
    • Tränas att förutsäga tokens i datamängden

 

  • Typer:
    • Nästa-ord-prediktion
    • Maskat språkmodellerande
Koncept inom stora språkmodeller (LLM)

Nästa-ord-prediktion

  • Övervakad inlärningsteknik
    • Modellen tränas på indata–utdata-par

 

  • Förutsäger nästa ord och genererar sammanhängande text
  • Fångar beroenden mellan ord

 

  • Träningsdata
    • Par av in- och utdataexempel

Autoförslag från en sökmotor

Koncept inom stora språkmodeller (LLM)

Träningsdata för nästa-ord-prediktion

Indata

The quick brown

The quick brown fox

The quick brown fox jumps

The quick brown fox jumps over

The quick brown fox jumps over the

The quick brown fox jumps over the lazy

The quick brown fox jumps over the lazy dog.

Utdata

fox

jumps

over

the

lazy

dog

Koncept inom stora språkmodeller (LLM)

Vilket ord hör ihop med pizza?

 

  • Fler exempel = bättre prediktion

 

  • Exempel:
    • Jag älskar att äta pizza med _ _ _ _ _ _

 

  • Ost har starkare koppling till pizza än de flesta andra ord

Sannolikheter för olika ords koppling till ordet "Pizza"

Koncept inom stora språkmodeller (LLM)

Maskat språkmodellerande

  • Döljer ett utvalt ord

  • Den tränade modellen förutsäger det maskade ordet

 

  • Originaltext: "The quick brown fox jumps over the lazy dog."

  • Maskad text: "The quick [MASK] fox jumps over the lazy dog."

 

  • Mål: förutsäga det saknade ordet

  • Baserat på lärdomar från träningsdata

Koncept inom stora språkmodeller (LLM)

Nu kör vi en övning!

Koncept inom stora språkmodeller (LLM)

Preparing Video For Download...