Pokročilé doladění

Koncepty velkých jazykových modelů (LLM)

Vidhi Chugh

AI strategist and ethicist

Kde se nacházíme?

Obrázek průběhu ukazující, že jsme ve fázi pokročilého doladění

Koncepty velkých jazykových modelů (LLM)

Zpětnovazební učení prostřednictvím lidské zpětné vazby

 

  • Předtrénování

 

  • Doladění

 

  • Zpětnovazební učení prostřednictvím lidské zpětné vazby (RLHF)

 

Ilustrace čtyř lidí poskytujících pozitivní zpětnou vazbu pomocí emoji a hvězdiček.

Koncepty velkých jazykových modelů (LLM)

Předtrénování

  • Velké množství textových dat:
    • Webové stránky, knihy a články
    • Architektura Transformer
    • Učí se obecné jazykové vzory, gramatiku a fakta

 

  • Predikce dalšího slova
  • Maskované jazykové modelování

Proces předtrénování pro sestavení LLM

1 Freepik
Koncepty velkých jazykových modelů (LLM)

Doladění

 

  • N-shot trénování

 

  • Malá označená datová sada pro příbuzný úkol

Proces doladění

Koncepty velkých jazykových modelů (LLM)

Proč ale RLHF?

  • Obecná trénovací data mají nízkou kvalitu
    • Šum
    • Chyby
    • Nekonzistence
    • Snížená přesnost

Příklad snížené přesnosti:

  • Trénováno na datech z online diskusních fór
  • Neověřené názory a fakta
  • Vyžaduje externí expertní validaci

 

Terč s šípy, které minuly střed

Koncepty velkých jazykových modelů (LLM)

Začíná potřebou doladění

  • Předtrénování
    • Učí se obecné jazykové vzory
    • Nezachycuje kontextové složitosti

 

  • Doladění
    • Kvalitní označená data zlepšují výkon

 

  • Přichází RLHF!
    • Zpětná vazba od lidí
Koncepty velkých jazykových modelů (LLM)

RLHF zjednodušeně

 

  • Výstup modelu kontroluje člověk
  • Model se aktualizuje na základě zpětné vazby

 

  • Krok 1:
    • Obdrží prompt
    • Vygeneruje více odpovědí

 

 

LLM zpracovávající vstupní prompt a generující odpověď

Koncepty velkých jazykových modelů (LLM)

Vstupuje lidský expert

 

  • Krok 2:
    • Odborník kontroluje odpovědi
    • Seřadí odpovědi podle kvality
      • Přesnost
      • Relevance
      • Koherence

Přidání lidské verifikace k odpovědím LLM

Koncepty velkých jazykových modelů (LLM)

Čas na zpětnou vazbu

  • Krok 3:
    • Učí se z hodnocení experta
    • Přizpůsobuje budoucí odpovědi jeho preferencím

 

  • A pokračuje dál!
    • Nadále generuje odpovědi
    • Přijímá hodnocení od experta
    • Upravuje učení

 

 

Zpětná vazba od člověka je předána zpět do LLM

Koncepty velkých jazykových modelů (LLM)

Shrnutí

  • Předtrénování pro obecné jazykové znalosti

 

  • Doladění pro specifické úlohy

 

  • RLHF pro zdokonalení doladění pomocí zpětné vazby od lidí

 

  • Kombinace je velmi účinná!
Koncepty velkých jazykových modelů (LLM)

Dokončení LLM

Kompletní proces trénování LLM

Koncepty velkých jazykových modelů (LLM)

Pojďme si procvičit!

Koncepty velkých jazykových modelů (LLM)

Preparing Video For Download...