高级微调

Large Language Models (LLMs) 概念

Vidhi Chugh

AI strategist and ethicist

我们到哪一步?

进度图:当前处于高级微调阶段

Large Language Models (LLMs) 概念

来自人类反馈的强化学习

 

  • 预训练

 

  • 微调

 

  • 人类反馈强化学习(RLHF)

 

四人用表情和星星给予正向反馈的插图。

Large Language Models (LLMs) 概念

预训练

  • 海量文本数据:
    • 网站、书籍、文章
    • Transformer 架构
    • 学习语言模式、语法与事实

 

  • 下一个词预测
  • 掩码语言建模

用于构建 LLM 的预训练流程

1 Freepik
Large Language Models (LLMs) 概念

微调

 

  • N-shot 训练

 

  • 相关任务的小型标注数据集

微调流程

Large Language Models (LLMs) 概念

但为什么是 RLHF?

  • 通用训练数据质量不足
    • 噪声
    • 错误
    • 不一致
    • 准确率下降

准确率下降示例:

  • 用在线论坛数据训练
  • 观点与事实未验证
  • 需要外部专家校验

 

箭偏离红心的射靶

Large Language Models (LLMs) 概念

从微调需求开始

  • 预训练
    • 学习底层语言模式
    • 难以捕捉特定情境复杂性

 

  • 微调
    • 高质量标注数据可提升性能

 

  • 引入 RLHF!
    • 人类反馈
Large Language Models (LLMs) 概念

RLHF 简化流程

 

  • 人工审核模型输出
  • 基于反馈更新模型

 

  • 步骤 1:
    • 接收提示
    • 生成多个回复

 

 

LLM 接收提示并生成回复

Large Language Models (LLMs) 概念

引入人类专家

 

  • 步骤 2:
    • 人类专家检查这些回复
    • 按质量排序
      • 准确性
      • 相关性
      • 连贯性

为 LLM 回复添加人工核验

Large Language Models (LLMs) 概念

进入反馈环节

  • 步骤 3:
    • 学习专家的排序
    • 使后续回复对齐其偏好

 

  • 持续迭代!
    • 持续生成回复
    • 接收专家排序
    • 调整学习

 

 

将人类反馈回传给 LLM

Large Language Models (LLMs) 概念

回顾

  • 预训练 学习通用语言知识

 

  • 微调 适配特定任务

 

  • RLHF 以人类反馈强化微调

 

  • 组合效果极佳!
Large Language Models (LLMs) 概念

完善 LLM

完整的 LLM 训练流程

Large Language Models (LLMs) 概念

Passons à la pratique !

Large Language Models (LLMs) 概念

Preparing Video For Download...