訓練 LLM 的基礎組件

Large Language Models (LLMs) 概念

Vidhi Chugh

AI strategist and ethicist

我們到哪一步了?

圖示學習進度為 Pre-training

Large Language Models (LLMs) 概念

生成式預訓練

 

  • 使用生成式預訓練來訓練

    • 輸入為文字權杖(tokens)
    • 目標是預測資料集中下一個權杖

 

  • 類型:
    • 下一詞預測
    • 遮罩式語言建模
Large Language Models (LLMs) 概念

下一詞預測

  • 監督式學習技巧
    • 模型以輸入—輸出配對訓練

 

  • 預測下一個詞並生成連貫文字
  • 捕捉詞與詞之間的相依性

 

  • 訓練資料
    • 輸入與輸出範例配對

搜尋引擎的自動建議

Large Language Models (LLMs) 概念

下一詞預測的訓練資料

Input

The quick brown

The quick brown fox

The quick brown fox jumps

The quick brown fox jumps over

The quick brown fox jumps over the

The quick brown fox jumps over the lazy

The quick brown fox jumps over the lazy dog.

Output

fox

jumps

over

the

lazy

dog

Large Language Models (LLMs) 概念

哪個詞和 pizza 更相關?

 

  • 範例越多,預測越好

 

  • 例如
    • I love to eat pizza with _ _ _ _ _ _

 

  • 起司與 pizza 的關聯性高於其他詞

不同單字與「Pizza」關聯機率

Large Language Models (LLMs) 概念

遮罩式語言建模

  • 隱藏某個詞

  • 訓練後的模型預測被遮罩的詞

 

  • 原始文字:「The quick brown fox jumps over the lazy dog.」

  • 遮罩文字:「The quick [MASK] fox jumps over the lazy dog.」

 

  • 目標:預測缺少的單字

  • 依據訓練資料中學到的知識

Large Language Models (LLMs) 概念

一起來練習吧!

Large Language Models (LLMs) 概念

Preparing Video For Download...