注意力機制

Large Language Models (LLMs) 概念

Vidhi Chugh

AI strategist and ethicist

注意力機制

  • 理解複雜結構
  • 聚焦重要詞彙

 

  • 閱讀類比
    • 推理小說中的線索
    • 聚焦相關內容
    • 專注關鍵輸入資料

打開的書與放大鏡

Large Language Models (LLMs) 概念

Self-attention 與 multi-head attention

Self-attention

  • 為每個詞加權其重要性

 

  • 捕捉長距依存關係

Multi-head attention

  • self-attention 的進階版

 

  • 將輸入切成多個 head,各自關注不同面向
Large Language Models (LLMs) 概念

派對中的注意力

  • Attention:Self 與 multi-head

 

  • 例子
    • 派對中的群聊
    • 選擇性注意相關的發言者
    • 過濾雜訊
    • 聚焦重點

 

人們坐著進行群體對話

1 Freepik
Large Language Models (LLMs) 概念

派對續集

Self-attention

  • 逐一關注每個人的話
  • 評估並比較其相關性
  • 為每位說話者的輸入加權
  • 彙整形成完整理解

Multi-head attention

  • 把注意力分成「多個」通道
  • 關注對話的不同面向
  • 例如情緒、主題與相關支線
  • 各面向處理後再合併
Large Language Models (LLMs) 概念

Multi-head attention 的優勢

  • 「The boy went to the store to buy some groceries, and he found a discount on his favorite cereal.」

 

  • Attention:「boy」、「store」、「groceries」、「discount」
  • Self-attention:「boy」與「he」→ 同一人
  • Multi-head attention:多個通道
    • 角色(「boy」)
    • 動作(「went to the store」、「found a discount」)
    • 涉及事物(「groceries」、「cereal」)
Large Language Models (LLMs) 概念

一起來練習吧!

Large Language Models (LLMs) 概念

Preparing Video For Download...