Zaawansowane dostrajanie

Koncepcje dużych modeli językowych (LLM)

Vidhi Chugh

AI strategist and ethicist

Gdzie jesteśmy?

Obraz postępu pokazujący etap zaawansowanego dostrajania

Koncepcje dużych modeli językowych (LLM)

Uczenie ze wzmocnieniem na podstawie informacji zwrotnej od człowieka

 

  • Pre-trening

 

  • Dostrajanie

 

  • Uczenie ze wzmocnieniem na podstawie informacji zwrotnej od człowieka (RLHF)

 

Ilustracja czterech osób wyrażających pozytywną opinię za pomocą emoji i gwiazdek.

Koncepcje dużych modeli językowych (LLM)

Pre-trening

  • Duże ilości danych tekstowych:
    • Strony internetowe, książki i artykuły
    • Architektura transformera
    • Uczy ogólnych wzorców językowych, gramatyki i faktów

 

  • Przewidywanie następnego słowa
  • Maskowane modelowanie języka

Proces pre-treningu do budowania LLM

1 Freepik
Koncepcje dużych modeli językowych (LLM)

Dostrajanie

 

  • Trening N-shot

 

  • Mały oznaczony zbiór danych dla pokrewnego zadania

Proces dostrajania

Koncepcje dużych modeli językowych (LLM)

Po co RLHF?

  • Ogólne dane treningowe są niskiej jakości
    • Szum
    • Błędy
    • Niespójności
    • Niska dokładność

Przykład niskiej dokładności:

  • Trening na danych z forów internetowych
  • Niezweryfikowane opinie i fakty
  • Wymaga zewnętrznej walidacji eksperckiej

 

Tarcza łucznicza ze strzałami, które chybiły środka

Koncepcje dużych modeli językowych (LLM)

Potrzeba dostrajania

  • Pre-trening
    • Uczy ogólnych wzorców językowych
    • Nie uchwyca złożoności kontekstowej

 

  • Dostrajanie
    • Oznaczone dane wysokiej jakości poprawiają wyniki

 

  • Z pomocą przychodzi RLHF!
    • Informacja zwrotna od człowieka
Koncepcje dużych modeli językowych (LLM)

RLHF w uproszczeniu

 

  • Wyniki modelu sprawdzane przez człowieka
  • Model aktualizowany na podstawie informacji zwrotnej

 

  • Krok 1:
    • Otrzymuje prompt
    • Generuje wiele odpowiedzi

 

 

LLM przetwarza prompt i generuje odpowiedź

Koncepcje dużych modeli językowych (LLM)

Rola eksperta

 

  • Krok 2:
    • Ekspert sprawdza odpowiedzi
    • Ocenia je według jakości
      • Dokładność
      • Trafność
      • Spójność

Weryfikacja odpowiedzi LLM przez człowieka

Koncepcje dużych modeli językowych (LLM)

Czas na informację zwrotną

  • Krok 3:
    • Uczy się na podstawie ocen eksperta
    • Dostosowuje przyszłe odpowiedzi do jego preferencji

 

  • I tak dalej!
    • Nadal generuje odpowiedzi
    • Otrzymuje oceny eksperta
    • Dostosowuje uczenie

 

 

Informacja zwrotna od człowieka przekazywana do LLM

Koncepcje dużych modeli językowych (LLM)

Podsumowanie

  • Pre-trening w celu nauki ogólnej wiedzy językowej

 

  • Dostrajanie dla konkretnych zadań

 

  • Techniki RLHF wzbogacające dostrajanie o informację zwrotną od człowieka

 

  • Połączenie jest bardzo skuteczne!
Koncepcje dużych modeli językowych (LLM)

Kompletny LLM

Kompletny proces trenowania LLM

Koncepcje dużych modeli językowych (LLM)

Czas na ćwiczenia!

Koncepcje dużych modeli językowych (LLM)

Preparing Video For Download...