進階微調
Large Language Models (LLMs) 概念
Vidhi Chugh
AI strategist and ethicist
我們在哪裡?
透過人類回饋的強化學習
預先訓練
微調
透過人類回饋的強化學習(RLHF)
預先訓練
大量文字資料:
網站、書籍與文章
Transformer 架構
學到一般語言模式、文法與事實
下一詞預測
遮罩式語言模型
1
Freepik
微調
N-shot 訓練
與任務相關的小型標註資料集
為什麼要用 RLHF?
通用訓練資料品質不足
噪音
錯誤
不一致
準確度下降
準確度下降的例子:
訓練資料來自線上討論論壇
未驗證的觀點與事實
需要外部專家驗證
從需要微調開始
預先訓練
學到底層語言模式
無法掌握情境特定的複雜性
微調
高品質標註資料可提升效能
接著是 RLHF!
加入人類回饋
RLHF 簡化說明
人類審閱模型輸出
依回饋更新模型
步驟 1:
接收提示
產生多個回應
引入人類專家
步驟 2:
人類專家檢查這些回應
依品質排序
準確性
相關性
連貫性
回饋時間
步驟 3:
從專家排序中學習
讓未來回應更符合其偏好
持續進行!
繼續產生回應
接收專家排序
調整學習
重點回顧
預先訓練
:學習一般語言知識
微調
:針對特定任務
RLHF
:藉由人類回饋強化微調
組合起來效果極佳!
完成 LLM
一起來練習吧!
Large Language Models (LLMs) 概念
Preparing Video For Download...