微調

Large Language Models (LLMs) 概念

Vidhi Chugh

AI strategist and ethicist

我們在哪裡?

進度圖,顯示我們已進入微調階段

Large Language Models (LLMs) 概念

 

  • Pre-training

以學童作為預訓練類比的圖片

          正規學校教育

 

  • Fine-tuning

以大學生作為微調類比的圖片

        大學專業化
1 Freepik
Large Language Models (LLMs) 概念

「大型」帶來的挑戰

  • 微調可協助
  • 強大的電腦
  • 高效率的模型訓練方法
  • 大量訓練資料

顯示資料可得性、訓練時間與運算力為打造 LLM 挑戰的圖片

Large Language Models (LLMs) 概念

運算能力

  • 記憶體

  • 處理效能

  • 基礎設施

  • 成本高昂

  • LLM
    • 數十萬顆中央處理器(CPUs)
    • 數萬顆繪圖處理器(GPUs)
  • 個人電腦:4–8 顆 CPU、1–2 顆 GPU

男子在連接大型伺服器的電腦前工作

1 Freepik
Large Language Models (LLMs) 概念

高效率模型訓練

象徵深度學習模型的插圖

  • 訓練時間極長

 

  • 可能需時數週甚至數月

 

  • 提升訓練效率=更快完成訓練

 

  • 單一 GPU 需 355 年運算時間
Large Language Models (LLMs) 概念

資料可得性

 

  • 需要高品質資料
  • 才能學到語言的複雜與細微之處
  • 數百 GB 級文字資料

    • 超過一百萬本書
  • 資料量極大

  兩疊溢出的資料夾象徵大量資料

Large Language Models (LLMs) 概念

克服這些挑戰

  • 微調
    • 可因應部分挑戰
    • 調整預訓練模型

 

  • 預訓練模型
    • 來自通用資料集學習
    • 未針對特定任務最佳化
    • 可為特定問題進行微調

多人在超大型筆電上用工具與齒輪作業,象徵微調

Large Language Models (LLMs) 概念

微調 vs. 預訓練

  • 微調

  • 運算

    • 1–2 顆 CPU 與 GPU

 

  • 訓練時間
    • 數小時到數天

 

  • 資料
    • 約 1 GB
  • 預訓練

  • 運算

    • 數千顆 CPU 與 GPU

 

  • 訓練時間
    • 數週到數月

 

  • 資料
    • 數百 GB
Large Language Models (LLMs) 概念

一起來練習吧!

Large Language Models (LLMs) 概念

Preparing Video For Download...