NLP 概觀

Large Language Models (LLMs) 概念

Vidhi Chugh

AI strategist and ethicist

目前進度

進度圖,顯示第一步:文字前處理

Large Language Models (LLMs) 概念

文字前處理

  • 彼此獨立,可調整順序

三個最常見的文字前處理步驟

Large Language Models (LLMs) 概念

Tokenization(斷詞)

  • 將文字切成獨立單字或是 tokens

 

  • Text:

    • "Working with natural language processing techniques is tricky."

     

  • Tokenization:

    • ["Working", "with", "natural", "language", "processing", "techniques", "is", "tricky", "."]
    • 轉為清單
Large Language Models (LLMs) 概念

移除停用詞

  • 停用詞不增添意義
  • 透過移除停用詞剔除

 

  • 移除前
    • ["Working", "with", "natural", "language", "processing", "techniques", "is", "challenging", "."]

 

  • 移除後
    • ["Working", "natural", "language", "processing", "techniques", "challenging", "."]
Large Language Models (LLMs) 概念

Lemmatization(詞形還原)

 

  • 將意義相近、形式略異的字聚在一起

 

  • 將字還原為基本型

 

  • 對應到詞根

 

  • Talking -> Talk

  • Talked -> Talk

  • Talk -> Talk

Large Language Models (LLMs) 概念

文字表示

進度圖,顯示已到文字表示階段

Large Language Models (LLMs) 概念

文字表示

 

  • 將文字資料轉為數值形式

 

  • Bag-of-words
  • Word embeddings

將語音以數字表示的示意圖

Large Language Models (LLMs) 概念

Bag-of-words

 

  • 將文字轉為詞頻矩陣

以 bag-of-words 表示的矩陣

  • 0 代表該詞不存在
Large Language Models (LLMs) 概念

Bag-of-words 的限制

  • 無法表達順序與脈絡

    • 可能導致誤解
    • 句型相似但意義相反
      • "The cat chased the mouse swiftly."
      • "The mouse chased the cat."
  • 無法捕捉詞與詞之間的語意

    • 將相關詞視為獨立
    • 例如「cat」與「mouse」
Large Language Models (LLMs) 概念

Word embeddings(詞向量)

  • 以數字表示語意

 

Cat Mouse
Plant -0.9 -0.8
Furry 0.9 0.7
Carnivore 0.9 -0.8

 

  • Cat [-0.9, 0.9, 0.9]
  • 捕食者—獵物關係:

捕食者—獵物的詞向量示意

Large Language Models (LLMs) 概念

機器可讀格式

 

  • 從文字前處理開始

資料準備流程

Large Language Models (LLMs) 概念

機器可讀格式

 

  • 將前處理後的文字轉為數值格式

含文字表示步驟的資料準備流程

Large Language Models (LLMs) 概念

一起來練習吧!

Large Language Models (LLMs) 概念

Preparing Video For Download...