高级微调
Large Language Models (LLMs) 概念
Vidhi Chugh
AI strategist and ethicist
我们到哪一步?
来自人类反馈的强化学习
预训练
微调
人类反馈强化学习(RLHF)
预训练
海量文本数据:
网站、书籍、文章
Transformer 架构
学习语言模式、语法与事实
下一个词预测
掩码语言建模
1
Freepik
微调
N-shot 训练
相关任务的小型标注数据集
但为什么是 RLHF?
通用训练数据质量不足
噪声
错误
不一致
准确率下降
准确率下降示例:
用在线论坛数据训练
观点与事实未验证
需要外部专家校验
从微调需求开始
预训练
学习底层语言模式
难以捕捉特定情境复杂性
微调
高质量标注数据可提升性能
引入 RLHF!
人类反馈
RLHF 简化流程
人工审核模型输出
基于反馈更新模型
步骤 1:
接收提示
生成多个回复
引入人类专家
步骤 2:
人类专家检查这些回复
按质量排序
准确性
相关性
连贯性
进入反馈环节
步骤 3:
学习专家的排序
使后续回复对齐其偏好
持续迭代!
持续生成回复
接收专家排序
调整学习
回顾
预训练
学习通用语言知识
微调
适配特定任务
RLHF
以人类反馈强化微调
组合效果极佳!
完善 LLM
Passons à la pratique !
Large Language Models (LLMs) 概念
Preparing Video For Download...