Dostrajanie

Koncepcje dużych modeli językowych (LLM)

Vidhi Chugh

AI strategist and ethicist

Gdzie jesteśmy?

Wykres postępu pokazujący, że osiągnęliśmy etap dostrajania

Koncepcje dużych modeli językowych (LLM)

 

  • Wstępne trenowanie

Obraz przedstawiający uczniów jako analogię wstępnego trenowania

          Edukacja szkolna

 

  • Dostrajanie

Obraz przedstawiający studentów jako analogię dostrajania

        Specjalizacja na uczelni
1 Freepik
Koncepcje dużych modeli językowych (LLM)

Wyzwania „wielkości"

  • Dostrajanie może pomóc
  • Wydajne komputery
  • Efektywne metody trenowania modeli
  • Duże ilości danych treningowych

Obraz pokazujący dostępność danych, czas trenowania i moc obliczeniową jako wyzwania budowania LLM

Koncepcje dużych modeli językowych (LLM)

Moc obliczeniowa

  • Pamięć

  • Moc przetwarzania

  • Infrastruktura

  • Wysokie koszty

  • LLM:
    • Setki tysięcy procesorów (CPU)
    • Dziesiątki tysięcy procesorów graficznych (GPU)
  • Komputer osobisty: 4–8 CPU i 1–2 GPU

Mężczyzna pracujący przy komputerze podłączonym do dużego serwera

1 Freepik
Koncepcje dużych modeli językowych (LLM)

Efektywne trenowanie modeli

Ilustracja symbolizująca model głębokiego uczenia

  • Czas trenowania jest bardzo długi

 

  • Może trwać tygodnie lub miesiące

 

  • Efektywne trenowanie = krótszy czas

 

  • 355 lat przetwarzania na jednym GPU
Koncepcje dużych modeli językowych (LLM)

Dostępność danych

 

  • Wymagane dane wysokiej jakości
  • Do nauki złożoności i niuansów języka
  • Kilkaset gigabajtów (GB) danych tekstowych

    • Ponad milion książek
  • Ogromna ilość danych

  Dwa stosy przepełnionych teczek symbolizujące duże zbiory danych

Koncepcje dużych modeli językowych (LLM)

Przezwyciężanie wyzwań

  • Dostrajanie
    • Rozwiązuje część tych wyzwań
    • Adaptuje wstępnie wytrenowany model

 

  • Model wstępnie wytrenowany
    • Uczony na danych ogólnych
    • Niezoptymalizowany pod konkretne zadania
    • Może być dostrojony do konkretnego problemu

Osoby pracujące przy dużym laptopie z narzędziami i kołami zębatymi symbolizującymi dostrajanie

Koncepcje dużych modeli językowych (LLM)

Dostrajanie a wstępne trenowanie

  • Dostrajanie

  • Moc obliczeniowa

    • 1–2 CPU i GPU

 

  • Czas trenowania
    • Godziny do dni

 

  • Dane
    • ~1 gigabajt
  • Wstępne trenowanie

  • Moc obliczeniowa

    • Tysiące CPU i GPU

 

  • Czas trenowania
    • Tygodnie do miesięcy

 

  • Dane
    • Setki gigabajtów
Koncepcje dużych modeli językowych (LLM)

Czas na ćwiczenia!

Koncepcje dużych modeli językowych (LLM)

Preparing Video For Download...