RLHFモデルの評価

人間のフィードバックによる強化学習(RLHF)

Mina Parham

AI Engineer

自動評価指標

 

  • 分類タスク:Accuracy、F1スコア
classification_results.head(3)
| ID | Feedback_Text                         | True_Category | Predicted_Category |
|----|---------------------------------------|---------------|--------------------|
| 1  | "Arrived on time and works great."    | Positive      | Positive           |
| 2  | "I had issues with customer service." | Negative      | Neutral            |
| 3  | "The website is easy to navigate."    | Positive      | Positive           |
人間のフィードバックによる強化学習(RLHF)

自動評価指標

 

  • 生成・要約:ROUGE、BLEU
text_generation.head(3)
| ID | Prompt               | True_Completion  | Pred_Completion   |
|----|----------------------|------------------|-------------------|
| 1  | "Customer service"   | "can help you."  | "will assist."    |
| 2  | "To get a refund,"   | "contact us."    | "reach out."      |
| 3  | "Support team is"    | "here 24/7."     | "available 24/7." |
人間のフィードバックによる強化学習(RLHF)

自動評価指標

 

 

参照文:

  • RLHFはモデルを人間の価値観に整合させる。

 

 

ROUGEスコア: 0.83

 

 

比較対象の文:

  • RLHFはモデルを人間の価値観に整合させる。
人間のフィードバックによる強化学習(RLHF)

アーティファクト曲線

config = PPOConfig(
    model_name="lvwerra/gpt2-imdb",learning_rate=1.41e-5, log_with="wandb")
import wandb
wandb.init()

Weights and Biasesのターミナル出力のスクリーンショット。

人間のフィードバックによる強化学習(RLHF)

アーティファクト曲線

  • 学習が進むと報酬は増加します。

モデルの改善を示す、報酬が上昇する曲線。

  • KL曲線は緩やかに上昇するのが望ましい。

KL損失が徐々に増える曲線。

人間のフィードバックによる強化学習(RLHF)

人間中心の評価

  • 人手評価:主観的判断や文脈の深い理解

ノートPCで評価する人。

  • モデル評価:スケーラブルで一貫性がある

モデル評価を表す、吹き出し付きのロボット。

人間のフィードバックによる強化学習(RLHF)

Vamos praticar!

人間のフィードバックによる強化学習(RLHF)

Preparing Video For Download...