Оценка моделей RLHF

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Mina Parham

AI Engineer

Метрики автоматической оценки

 

  • Задача классификации: Accuracy, F1 score
classification_results.head(3)
| ID | Feedback_Text                         | True_Category | Predicted_Category |
|----|---------------------------------------|---------------|--------------------|
| 1  | "Arrived on time and works great."    | Positive      | Positive           |
| 2  | "I had issues with customer service." | Negative      | Neutral            |
| 3  | "The website is easy to navigate."    | Positive      | Positive           |
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Метрики автоматической оценки

 

  • Генерация текста, суммаризация: ROUGE, BLEU
text_generation.head(3)
| ID | Prompt               | True_Completion  | Pred_Completion   |
|----|----------------------|------------------|-------------------|
| 1  | "Customer service"   | "can help you."  | "will assist."    |
| 2  | "To get a refund,"   | "contact us."    | "reach out."      |
| 3  | "Support team is"    | "here 24/7."     | "available 24/7." |
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Метрики автоматической оценки

 

 

Эталонное утверждение:

  • RLHF улучшает согласованность модели с ценностями человека.

 

 

Оценка ROUGE: 0.83

 

 

Сравниваемое утверждение:

  • RLHF согласует модели с ценностями человека.
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Кривые артефактов

config = PPOConfig(
    model_name="lvwerra/gpt2-imdb",learning_rate=1.41e-5, log_with="wandb")
import wandb
wandb.init()

Снимок экрана с выводом терминала в Weights and Biases.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Кривые артефактов

  • Вознаграждение растёт по мере обучения модели.

Кривая с восходящим трендом вознаграждения, отражающая улучшение модели.

  • Кривая KL должна возрастать постепенно.

Кривая с постепенным восходящим трендом потерь KL.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Оценка с участием человека

  • Оценка людьми: субъективные суждения и глубокое понимание контекста

Эксперт-оценщик за ноутбуком.

  • Оценка моделями: масштабируемость и согласованность

Робот с речевыми пузырями, символизирующий модель-оценщик.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Давайте потренируемся!

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Preparing Video For Download...