Elementy treningu LLM

Koncepcje dużych modeli językowych (LLM)

Vidhi Chugh

AI strategist and ethicist

Gdzie jesteśmy?

Obraz pokazujący postęp nauki jako Pre-training

Koncepcje dużych modeli językowych (LLM)

Generative pre-training

 

  • Trenowane metodą generative pre-training

    • Dane wejściowe to tokeny tekstu
    • Model uczy się przewidywać tokeny w zbiorze

 

  • Rodzaje:
    • Przewidywanie kolejnego słowa
    • Masked language modeling
Koncepcje dużych modeli językowych (LLM)

Przewidywanie kolejnego słowa

  • Technika uczenia nadzorowanego
    • Model uczony na parach wejście-wyjście

 

  • Przewiduje kolejne słowo i generuje spójny tekst
  • Wychwytuje zależności między słowami

 

  • Dane treningowe
    • Pary przykładów wejścia i wyjścia

Autopodpowiedź w wyszukiwarce

Koncepcje dużych modeli językowych (LLM)

Dane treningowe do przewidywania słów

Wejście

The quick brown

The quick brown fox

The quick brown fox jumps

The quick brown fox jumps over

The quick brown fox jumps over the

The quick brown fox jumps over the lazy

The quick brown fox jumps over the lazy dog.

Wyjście

fox

jumps

over

the

lazy

dog

Koncepcje dużych modeli językowych (LLM)

Które słowo bardziej pasuje do pizzy?

 

  • Więcej przykładów = lepsza predykcja

 

  • Przykład:
    • Uwielbiam jeść pizzę z _ _ _ _ _ _

 

  • Ser jest bardziej powiązany z pizzą niż cokolwiek innego

Prawdopodobieństwa skojarzeń różnych słów ze słowem "Pizza"

Koncepcje dużych modeli językowych (LLM)

Masked language modeling

  • Ukrywa wybrane słowo

  • Wytrenowany model przewiduje zamaskowane słowo

 

  • Tekst oryginalny: "The quick brown fox jumps over the lazy dog."

  • Tekst zamaskowany: "The quick [MASK] fox jumps over the lazy dog."

 

  • Cel: przewidzieć brakujące słowo

  • Na podstawie wiedzy z danych treningowych

Koncepcje dużych modeli językowych (LLM)

Czas na praktykę!

Koncepcje dużych modeli językowych (LLM)

Preparing Video For Download...