RLHF 简介

来自人类反馈的强化学习(RLHF)

Mina Parham

AI Engineer

欢迎来到本课程!

 

  • 讲师:Mina Parham

 

  • AI 工程师
  • 大型语言模型(LLM)
  • 人类反馈强化学习(RLHF)

 

  • 主题:人类反馈强化学习(RLHF)

一个图示,表示 AI 模型包含一个人工参与的额外步骤。

来自人类反馈的强化学习(RLHF)

欢迎来到本课程!

 

  • 讲师:Mina Parham

 

  • AI 工程师
  • 大型语言模型(LLM)
  • 人类反馈强化学习(RLHF)

 

  • 主题:人类反馈强化学习(RLHF)

一个图示,表示 AI 模型包含一个人工参与的额外步骤,带来更好结果。

来自人类反馈的强化学习(RLHF)

强化学习回顾

一个图示,包含智能体、动作与奖励策略循环,表示强化学习过程。

来自人类反馈的强化学习(RLHF)

强化学习回顾

一个图示,包含智能体、动作与奖励策略循环,表示强化学习过程。

来自人类反馈的强化学习(RLHF)

强化学习回顾

一个图示,包含智能体、动作与奖励策略循环,表示强化学习过程。

来自人类反馈的强化学习(RLHF)

强化学习回顾

一个图示,包含智能体、动作与奖励策略循环,表示强化学习过程。

来自人类反馈的强化学习(RLHF)

从 RL 到 RLHF

 

  一个图示,包含 LLM、文本输出与人工评估者,表示人类反馈强化学习的一部分循环。

来自人类反馈的强化学习(RLHF)

从 RL 到 RLHF

 

  一个图示,包含 LLM、文本输出与人工评估者,表示人类反馈强化学习的一部分循环。

来自人类反馈的强化学习(RLHF)

从 RL 到 RLHF

  • 训练奖励模型
  • 与人类偏好对齐

一个图示,包含 LLM、文本输出与人工评估者,表示人类反馈强化学习的一部分循环。

来自人类反馈的强化学习(RLHF)

RLHF 中的 LLM 微调

 

大型语言模型图标。

来自人类反馈的强化学习(RLHF)

RLHF 中的 LLM 微调

  • 训练初始 LLM

使用输入数据集微调大型语言模型的图标。

来自人类反馈的强化学习(RLHF)

RLHF 全流程

一个提示"Who wrote Romeo and Juliet"输入到 LLM。

来自人类反馈的强化学习(RLHF)

RLHF 全流程

一个提示"Who wrote Romeo and Juliet",LLM 回答:"a 16th Century author"。

来自人类反馈的强化学习(RLHF)

RLHF 全流程

一个提示"Who wrote Romeo and Juliet",LLM 回答:"a 16th Century author",另有一个策略模型接收该提示。

来自人类反馈的强化学习(RLHF)

RLHF 全流程

一个提示"Who wrote Romeo and Juliet",LLM 回答:"a 16th Century author",策略模型接收提示并用奖励模型训练。

来自人类反馈的强化学习(RLHF)

RLHF 全流程

一个提示"Who wrote Romeo and Juliet",LLM 回答:"a 16th Century author",策略模型在奖励模型训练下给出答案"William Shakespeare"。

来自人类反馈的强化学习(RLHF)

RLHF 全流程

一个提示"Who wrote Romeo and Juliet",LLM 回答:"a 16th Century author";策略模型在奖励模型训练下给出"William Shakespeare",并比较两者结果。

来自人类反馈的强化学习(RLHF)

与 RLHF 微调的 LLM 交互

  • Hugging Face 上的预训练 RLHF 模型 🤗
from transformers import pipeline

text_generator = pipeline('text-generation', model='lvwerra/gpt2-imdb-pos-v2')
# Provide a review prompt review_prompt = "This is definitely a" # Generate the continuation output = text_generator(review_prompt, max_length=50) #Print the generated text print(output[0]['generated_text'])
This is definitely a crucial improvement.
来自人类反馈的强化学习(RLHF)

与 RLHF 微调的 LLM 交互

from transformers import pipeline, AutoModelForSequenceClassification, AutoTokenizer


# Instantiate the pre-trained model and tokenizer model = AutoModelForSequenceClassification.from_pretrained("lvwerra/distilbert-imdb") tokenizer = AutoTokenizer.from_pretrained("lvwerra/distilbert-imdb")
# Use pipeline to create the sentiment analyzer sentiment_analyzer = pipeline('sentiment-analysis', model=model, tokenizer=tokenizer) # Pass the text to the sentiment analyzer and print the result sentiment = sentiment_analyzer("This is definitely a crucial improvement.")
print(f"Sentiment Analysis Result: {sentiment}")
positive
来自人类反馈的强化学习(RLHF)

Vamos praticar!

来自人类反馈的强化学习(RLHF)

Preparing Video For Download...