训练 LLM 的基础模块

Large Language Models (LLMs) 概念

Vidhi Chugh

AI strategist and ethicist

我们进行到哪一步?

显示"预训练"学习进度的图片

Large Language Models (LLMs) 概念

生成式预训练

 

  • 使用生成式预训练

    • 输入为文本 token
    • 训练以预测数据集中的 token

 

  • 类型:
    • 下一词预测
    • 掩码语言模型
Large Language Models (LLMs) 概念

下一词预测

  • 监督学习方法
    • 基于输入-输出对训练

 

  • 预测下一个词并生成连贯文本
  • 捕捉词间依赖关系

 

  • 训练数据
    • 输入与输出示例对

搜索引擎的自动补全示例

Large Language Models (LLMs) 概念

下一词预测的训练数据

输入

The quick brown

The quick brown fox

The quick brown fox jumps

The quick brown fox jumps over

The quick brown fox jumps over the

The quick brown fox jumps over the lazy

The quick brown fox jumps over the lazy dog.

输出

fox

jumps

over

the

lazy

dog

Large Language Models (LLMs) 概念

哪个词与披萨更相关?

 

  • 示例越多,预测越好

 

  • 例如
    • I love to eat pizza with _ _ _ _ _ _

 

  • 奶酪与披萨的关联性最高

不同词与"Pizza"的关联概率

Large Language Models (LLMs) 概念

掩码语言模型(MLM)

  • 隐藏选定词

  • 训练好的模型预测被遮盖的词

 

  • 原句:"The quick brown fox jumps over the lazy dog."

  • 遮盖后:"The quick [MASK] fox jumps over the lazy dog."

 

  • 目标:预测缺失词

  • 基于训练数据中的学习

Large Language Models (LLMs) 概念

Passons à la pratique !

Large Language Models (LLMs) 概念

Preparing Video For Download...