進階微調

Large Language Models (LLMs) 概念

Vidhi Chugh

AI strategist and ethicist

我們在哪裡?

進度圖:目前位於進階微調階段

Large Language Models (LLMs) 概念

透過人類回饋的強化學習

 

  • 預先訓練

 

  • 微調

 

  • 透過人類回饋的強化學習(RLHF)

 

四個人用表情符號與星星給出正向回饋的插圖。

Large Language Models (LLMs) 概念

預先訓練

  • 大量文字資料:
    • 網站、書籍與文章
    • Transformer 架構
    • 學到一般語言模式、文法與事實

 

  • 下一詞預測
  • 遮罩式語言模型

建立 LLM 的預先訓練流程

1 Freepik
Large Language Models (LLMs) 概念

微調

 

  • N-shot 訓練

 

  • 與任務相關的小型標註資料集

微調流程

Large Language Models (LLMs) 概念

為什麼要用 RLHF?

  • 通用訓練資料品質不足
    • 噪音
    • 錯誤
    • 不一致
    • 準確度下降

準確度下降的例子:

  • 訓練資料來自線上討論論壇
  • 未驗證的觀點與事實
  • 需要外部專家驗證

 

射箭靶心,箭矢未中紅心

Large Language Models (LLMs) 概念

從需要微調開始

  • 預先訓練
    • 學到底層語言模式
    • 無法掌握情境特定的複雜性

 

  • 微調
    • 高品質標註資料可提升效能

 

  • 接著是 RLHF!
    • 加入人類回饋
Large Language Models (LLMs) 概念

RLHF 簡化說明

 

  • 人類審閱模型輸出
  • 依回饋更新模型

 

  • 步驟 1:
    • 接收提示
    • 產生多個回應

 

 

LLM 接收輸入提示並產生回應

Large Language Models (LLMs) 概念

引入人類專家

 

  • 步驟 2:
    • 人類專家檢查這些回應
    • 依品質排序
      • 準確性
      • 相關性
      • 連貫性

替 LLM 回應加入人工驗證

Large Language Models (LLMs) 概念

回饋時間

  • 步驟 3:
    • 從專家排序中學習
    • 讓未來回應更符合其偏好

 

  • 持續進行!
    • 繼續產生回應
    • 接收專家排序
    • 調整學習

 

 

將人類回饋送回 LLM

Large Language Models (LLMs) 概念

重點回顧

  • 預先訓練:學習一般語言知識

 

  • 微調:針對特定任務

 

  • RLHF:藉由人類回饋強化微調

 

  • 組合起來效果極佳!
Large Language Models (LLMs) 概念

完成 LLM

完整的 LLM 訓練流程

Large Language Models (LLMs) 概念

一起來練習吧!

Large Language Models (LLMs) 概念

Preparing Video For Download...