NLP 概览

Large Language Models (LLMs) 概念

Vidhi Chugh

AI strategist and ethicist

我们在哪一步?

进度图显示第一步:文本预处理

Large Language Models (LLMs) 概念

文本预处理

  • 彼此独立,可按不同顺序执行

文本预处理的三步

Large Language Models (LLMs) 概念

分词(Tokenization)

  • 将文本拆分为独立的词,称为词元(token)

 

  • 文本:

    • "Working with natural language processing techniques is tricky."

     

  • 分词:

    • ["Working", "with", "natural", "language", "processing", "techniques", "is", "tricky", "."]
    • 转为列表
Large Language Models (LLMs) 概念

停用词移除

  • 停用词不增加含义
  • 通过移除停用词剔除

 

  • 移除前:
    • ["Working", "with", "natural", "language", "processing", "techniques", "is", "challenging", "."]

 

  • 移除后:
    • ["Working", "natural", "language", "processing", "techniques", "challenging", "."]
Large Language Models (LLMs) 概念

词形还原(Lemmatization)

 

  • 将含义相近的不同词归类

 

  • 还原为基础形式

 

  • 映射到词根

 

  • Talking -> Talk

  • Talked -> Talk

  • Talk -> Talk

Large Language Models (LLMs) 概念

文本表示

进度图显示我们已到达文本表示阶段

Large Language Models (LLMs) 概念

文本表示

 

  • 将文本数据转为数值形式

 

  • 词袋模型
  • 词向量

展示语音以数字表示的图像

Large Language Models (LLMs) 概念

词袋模型

 

  • 将文本转为词频矩阵

词袋表示的矩阵

  • 0 表示该词缺失
Large Language Models (LLMs) 概念

词袋模型的局限

  • 不捕捉顺序或上下文

    • 可能导致误解
    • 句式相似但含义相反
      • "The cat chased the mouse swiftly."
      • "The mouse chased the cat."
  • 不捕捉词间语义

    • 将相关词视为独立
    • 如 "cat" 与 "mouse"
Large Language Models (LLMs) 概念

词向量

  • 以数字捕捉语义

 

Cat Mouse
Plant -0.9 -0.8
Furry 0.9 0.7
Carnivore 0.9 -0.8

 

  • Cat [-0.9, 0.9, 0.9]
  • 捕食-猎物关系:

捕食-猎物的词向量

Large Language Models (LLMs) 概念

机器可读形式

 

  • 从文本预处理开始

数据准备流程

Large Language Models (LLMs) 概念

机器可读形式

 

  • 将预处理文本转为数值格式

含文本表示步骤的数据准备流程

Large Language Models (LLMs) 概念

Passons à la pratique !

Large Language Models (LLMs) 概念

Preparing Video For Download...