Продвинутая тонкая настройка

Концепции больших языковых моделей (LLM)

Vidhi Chugh

AI strategist and ethicist

Где мы сейчас?

изображение прогресса, показывающее этап продвинутой тонкой настройки

Концепции больших языковых моделей (LLM)

Обучение с подкреплением на основе обратной связи от людей

 

  • Предобучение

 

  • Тонкая настройка

 

  • Обучение с подкреплением на основе обратной связи от людей (RLHF)

 

Иллюстрация четырёх людей, оставляющих положительную обратную связь с помощью эмодзи и звёзд.

Концепции больших языковых моделей (LLM)

Предобучение

  • Большие объёмы текстовых данных:
    • Сайты, книги и статьи
    • Архитектура трансформера
    • Усваивает общие языковые закономерности, грамматику и факты

 

  • Предсказание следующего слова
  • Маскированное языковое моделирование

Процесс предобучения для построения LLM

1 Freepik
Концепции больших языковых моделей (LLM)

Тонкая настройка

 

  • N-shot обучение

 

  • Небольшой размеченный набор данных для связанной задачи

Процесс тонкой настройки

Концепции больших языковых моделей (LLM)

Но зачем нужен RLHF?

  • Данные общего назначения недостаточно качественны
    • Шум
    • Ошибки
    • Несоответствия
    • Снижение точности

Пример снижения точности:

  • Обучение на данных с интернет-форумов
  • Непроверенные мнения и факты
  • Требуется внешняя экспертная проверка

 

Мишень со стрелами, не попавшими в центр

Концепции больших языковых моделей (LLM)

Начинается с необходимости тонкой настройки

  • Предобучение
    • Усваивает базовые языковые закономерности
    • Не улавливает контекстные сложности

 

  • Тонкая настройка
    • Качественные размеченные данные улучшают результат

 

  • На сцену выходит RLHF!
    • Обратная связь от людей
Концепции больших языковых моделей (LLM)

RLHF: упрощённое объяснение

 

  • Вывод модели проверяется человеком
  • Модель обновляется на основе обратной связи

 

  • Шаг 1:
    • Получает запрос
    • Генерирует несколько ответов

 

 

LLM получает входной запрос и генерирует ответ

Концепции больших языковых моделей (LLM)

Подключается эксперт

 

  • Шаг 2:
    • Эксперт проверяет полученные ответы
    • Ранжирует их по качеству
      • Точность
      • Релевантность
      • Связность

добавление экспертной проверки ответов LLM

Концепции больших языковых моделей (LLM)

Время для обратной связи

  • Шаг 3:
    • Обучается на основе ранжирования эксперта
    • Чтобы в дальнейшем согласовывать ответы с его предпочтениями

 

  • И так по кругу!
    • Продолжает генерировать ответы
    • Получает оценки эксперта
    • Корректирует обучение

 

 

Обратная связь от человека передаётся обратно в LLM

Концепции больших языковых моделей (LLM)

Итоги

  • Предобучение для освоения общих языковых знаний

 

  • Тонкая настройка для решения конкретных задач

 

  • RLHF для улучшения тонкой настройки с помощью обратной связи от людей

 

  • Совместное применение даёт наилучший результат!
Концепции больших языковых моделей (LLM)

Завершение построения LLM

Полный процесс обучения LLM

Концепции больших языковых моделей (LLM)

Давайте потренируемся!

Концепции больших языковых моделей (LLM)

Preparing Video For Download...