模型評估

生成式 AI 概念

Daniel Tedesco

Data Lead, Google

為什麼要評估?

評估模型的效能與效果:

  • 衡量進展
  • 嚴謹比較模型
  • 以人類表現為基準
生成式 AI 概念

評估生成式 AI

量化指標

數字,代表量化指標

  • 區別式模型評估指標
  • 生成式模型專屬指標

以人為本的指標

對話氣泡,代表以人為本的指標

  • 與人類表現比較
  • 智慧式評估
生成式 AI 概念

區別式模型的評估技術

在界定清楚的任務上量測表現

優點

  • 廣為接受、易於理解
  • 易於計算與比較

缺點

  • 無法反映生成內容的主觀性

靶心旁有飛鏢。

生成式 AI 概念

生成式模型專屬指標

為特定生成任務量身打造

優點

  • 更細緻的準則,如真實感、多樣性、新穎性
  • 許多知名指標可用

缺點

  • 難以涵蓋多數主觀面向
  • 常無法通用化

多張乳牛插圖。

生成式 AI 概念

與人類表現比較

 

優點

  • 以人類能力為基準比較
  • 展現實務可用性

缺點

  • 可能是不公平的比較

AI 與人類競賽。

生成式 AI 概念

得獎的 AI

人類競賽

得獎的 AI 生成藝術作品,配有藍色獎帶

人類標準化測驗

一張圖表顯示 GPT-4 在多項人類標準化測驗上的表現。它在如 Uniform Bar Exam 與 GRE 等知名測驗上表現優於多數學生。

1 https://twitter.com/colostatefair/status/1565486317839863809, OpenAI
生成式 AI 概念

黃金標準

由人或其他 AI 進行智慧式評估

優點:

  • 能捕捉主觀面向

缺點:

  • 緩慢、成本高,且難以標準化
  • 易受人類偏見與不一致影響
生成式 AI 概念

圖靈的經典測試

 

  • 由電腦科學家 Alan Turing 提出
  • 由人類評審判斷 AI 生成內容
  • 若無法分辨 AI 與人類,則算通過
  • 但人類行為未必總是合適的標準

圖靈測試示意:一位人類評審、螢幕上的 AI 生成與人類生成內容,用於判別兩者。

生成式 AI 概念

一起來練習吧!

生成式 AI 概念

Preparing Video For Download...