Просунуте донавчання

Концепції Large Language Models (LLMs)

Vidhi Chugh

AI strategist and ethicist

Де ми зараз?

зображення прогресу: ми на етапі просунутого донавчання

Концепції Large Language Models (LLMs)

Навчання з підкріпленням із людським зворотним зв'язком

 

  • Попереднє навчання

 

  • Донавчання

 

  • Навчання з підкріпленням за допомогою людського зворотного зв'язку (RLHF)

 

Ілюстрація: четверо людей лишають позитивний відгук за допомогою емодзі та зірок.

Концепції Large Language Models (LLMs)

Попереднє навчання

  • Великі обсяги текстових даних:
    • Вебсайти, книжки та статті
    • Архітектура Transformer
    • Вивчає загальні мовні патерни, граматику й факти

 

  • Прогноз наступного слова
  • Масковане моделювання мови

Процес попереднього навчання для побудови LLM

1 Freepik
Концепції Large Language Models (LLMs)

Донавчання

 

  • N-shot навчання

 

  • Невеликий розмічений набір даних для спорідненого завдання

Процес донавчання

Концепції Large Language Models (LLMs)

Чому саме RLHF?

  • Дані загального призначення часто низької якості
    • Шум
    • Помилки
    • Невідповідності
    • Нижча точність

Приклад зниження точності:

  • Навчання на даних з онлайн-форумів
  • Неперевірені думки та факти
  • Потрібна зовнішня експертна валідація

 

Мішень для стрільби з луком зі стрілами, що не влучили в «яблучко»

Концепції Large Language Models (LLMs)

Починається з потреби в донавчанні

  • Попереднє навчання
    • Вивчає базові мовні закономірності
    • Не охоплює контекстні нюанси

 

  • Донавчання
    • Якісна розмітка підвищує якість

 

  • Тут входить RLHF!
    • Людський зворотний зв'язок
Концепції Large Language Models (LLMs)

Спрощено про RLHF

 

  • Вихід моделі переглядає людина
  • Модель оновлюється за цим відгуком

 

  • Крок 1:
    • Отримує підказку (prompt)
    • Генерує кілька відповідей

 

 

LLM отримує вхідний prompt і генерує відповідь

Концепції Large Language Models (LLMs)

Долучається експерт

 

  • Крок 2:
    • Експерт перевіряє відповіді
    • Ранжує їх за якістю
      • Точність
      • Доречність
      • Зв'язність

додавання людської перевірки до відповіді LLM

Концепції Large Language Models (LLMs)

Час для відгуку

  • Крок 3:
    • Вчиться на ранжуванні експерта
    • Щоб узгоджувати майбутні відповіді з його вподобаннями

 

  • І так по колу!
    • Продовжує генерувати відповіді
    • Отримує оцінки експерта
    • Коригує навчання

 

 

Людський відгук повертається в LLM

Концепції Large Language Models (LLMs)

Підсумок

  • Попереднє навчання для загальних мовних знань

 

  • Донавчання для конкретних завдань

 

  • RLHF підсилює донавчання завдяки людському відгуку

 

  • Поєднання дуже ефективне!
Концепції Large Language Models (LLMs)

Завершення LLM

Повний процес навчання LLM

Концепції Large Language Models (LLMs)

Давайте потренуємось!

Концепції Large Language Models (LLMs)

Preparing Video For Download...