RLHF入門

人間のフィードバックによる強化学習(RLHF)

Mina Parham

AI Engineer

コースへようこそ

 

  • 講師: Mina Parham

 

  • AIエンジニア
  • 大規模言語モデル (LLM)
  • 人間のフィードバックによる強化学習 (RLHF)

 

  • トピック: 人間のフィードバックによる強化学習 (RLHF)

人間が介在する追加ステップを持つAIモデルの図。

人間のフィードバックによる強化学習(RLHF)

コースへようこそ

 

  • 講師: Mina Parham

 

  • AIエンジニア
  • 大規模言語モデル (LLM)
  • 人間のフィードバックによる強化学習 (RLHF)

 

  • トピック: 人間のフィードバックによる強化学習 (RLHF)

人間が介在する追加ステップを持ち、より良い結果につながるAIモデルの図。

人間のフィードバックによる強化学習(RLHF)

強化学習の復習

エージェント、行動、報酬方策が循環する強化学習プロセスの図。

人間のフィードバックによる強化学習(RLHF)

強化学習の復習

エージェント、行動、報酬方策が循環する強化学習プロセスの図。

人間のフィードバックによる強化学習(RLHF)

強化学習の復習

エージェント、行動、報酬方策が循環する強化学習プロセスの図。

人間のフィードバックによる強化学習(RLHF)

強化学習の復習

エージェント、行動、報酬方策が循環する強化学習プロセスの図。

人間のフィードバックによる強化学習(RLHF)

RLからRLHFへ

 

  LLM、テキスト出力、人間評価者のアイコンが示され、RLHFの一部の循環を表す図。

人間のフィードバックによる強化学習(RLHF)

RLからRLHFへ

 

  LLM、テキスト出力、人間評価者のアイコンが示され、RLHFの一部の循環を表す図。

人間のフィードバックによる強化学習(RLHF)

RLからRLHFへ

  • 報酬モデルの学習
  • 人間の嗜好へのアラインメント

LLM、テキスト出力、人間評価者のアイコンが示され、RLHFの一部の循環を表す図。

人間のフィードバックによる強化学習(RLHF)

RLHFにおけるLLMの微調整

 

大規模言語モデルのアイコン。

人間のフィードバックによる強化学習(RLHF)

RLHFにおけるLLMの微調整

  • 初期LLMの学習

入力データセットで微調整される大規模言語モデルのアイコン。

人間のフィードバックによる強化学習(RLHF)

RLHFの全体プロセス

「ロミオとジュリエットの作者は?」というプロンプトがLLMに入力される図。

人間のフィードバックによる強化学習(RLHF)

RLHFの全体プロセス

「ロミオとジュリエットの作者は?」というプロンプトに対し、LLMが「16世紀の作家」と回答する図。

人間のフィードバックによる強化学習(RLHF)

RLHFの全体プロセス

「ロミオとジュリエットの作者は?」というプロンプトに対し、LLMが「16世紀の作家」と回答し、追加のポリシーモデルも同プロンプトを受け取る図。

人間のフィードバックによる強化学習(RLHF)

RLHFの全体プロセス

同プロンプトに対しLLMが「16世紀の作家」と回答し、ポリシーモデルが報酬モデルで学習される図。

人間のフィードバックによる強化学習(RLHF)

RLHFの全体プロセス

同プロンプトで、報酬モデルで学習されたポリシーモデルが「William Shakespeare」と回答する図。

人間のフィードバックによる強化学習(RLHF)

RLHFの全体プロセス

同プロンプトで、LLMの「16世紀の作家」とポリシーモデルの「William Shakespeare」を比較チェックする図。

人間のフィードバックによる強化学習(RLHF)

RLHF調整済みLLMとの対話

  • Hugging Face の事前学習済みRLHFモデル 🤗
from transformers import pipeline

text_generator = pipeline('text-generation', model='lvwerra/gpt2-imdb-pos-v2')
# Provide a review prompt review_prompt = "This is definitely a" # Generate the continuation output = text_generator(review_prompt, max_length=50) #Print the generated text print(output[0]['generated_text'])
This is definitely a crucial improvement.
人間のフィードバックによる強化学習(RLHF)

RLHF調整済みLLMとの対話

from transformers import pipeline, AutoModelForSequenceClassification, AutoTokenizer


# Instantiate the pre-trained model and tokenizer model = AutoModelForSequenceClassification.from_pretrained("lvwerra/distilbert-imdb") tokenizer = AutoTokenizer.from_pretrained("lvwerra/distilbert-imdb")
# Use pipeline to create the sentiment analyzer sentiment_analyzer = pipeline('sentiment-analysis', model=model, tokenizer=tokenizer) # Pass the text to the sentiment analyzer and print the result sentiment = sentiment_analyzer("This is definitely a crucial improvement.")
print(f"Sentiment Analysis Result: {sentiment}")
positive
人間のフィードバックによる強化学習(RLHF)

Ayo berlatih!

人間のフィードバックによる強化学習(RLHF)

Preparing Video For Download...