資料疑慮與考量

Large Language Models (LLMs) 概念

Vidhi Chugh

AI strategist and ethicist

資料考量

 

資料考量

 

  • 資料量與運算能力
  • 資料品質
  • 標註
  • 偏見
  • 隱私
Large Language Models (LLMs) 概念

資料量與運算能力

  • LLM 需要大量資料
    • 類似小孩學說話
    • 570 GB,約 130 萬本書

 

小孩學說話

1 Freepik
Large Language Models (LLMs) 概念

資料量與運算能力

  • LLM 需要大量資料
    • 類似小孩學說話
    • 570 GB,約 130 萬本書

 

  • 需要龐大運算力;也要考量能耗

 

  • 成本可能高達數百萬美元!

人在操作連接大型伺服器的電腦

Large Language Models (LLMs) 概念

資料品質

  • 高品質資料不可或缺

 

  • 資料越準確=學習越好=回應品質越高=信任度提升

 

  • 以小孩學說話為例
    • 垃圾輸入→垃圾輸出

若以錯誤或文法差的資料訓練 LLM,將產生低品質輸出

Large Language Models (LLMs) 概念

標註資料

  • 正確標註:學得精準、能概括模式、回應正確

  • 高度耗工:為每篇文章指派正確標籤

團隊以電腦進行資料標註

  • 標註錯誤會影響模型表現
  • 修正流程:辨識 → 分析 → 反覆改進
Large Language Models (LLMs) 概念

資料偏見

  • 受社會刻板印象影響
  • 訓練資料缺乏多樣性
  • 可能導致歧視與不公平結果

 

  • 發現並處理偏見資料
    • 評估資料不平衡
    • 促進多樣性
    • 偏見緩解技巧:加入更多多元範例

資料偏見

  • 例子:

    • 「The nurse said that...」→「she」或「her」
Large Language Models (LLMs) 概念

資料隱私

  • 遵循資料保護與隱私法規

 

  • 隱私是重要議題
    • 未經許可訓練資料可能造成外洩
    • 引發法律、財務與名譽風險
  • 敏感或可識別個人身分(PII)的資訊

 

  • 取得許可

資料隱私

Large Language Models (LLMs) 概念

一起來練習吧!

Large Language Models (LLMs) 概念

Preparing Video For Download...