Оцінювання моделі

Концепції Generative AI

Daniel Tedesco

Data Lead, Google

Навіщо оцінювати?

Оцініть результативність і ефективність моделі:

  • Вимірюйте прогрес
  • Ретельно порівнюйте моделі
  • Зіставляйте з людською продуктивністю
Концепції Generative AI

Оцінювання генеративних ШІ

Кількісні метрики

Числа, що символізують кількісні метрики

  • Метрики оцінювання дискримінативних моделей
  • Спеціальні метрики для генеративних моделей

Людиноцентричні метрики

Діалогові хмаринки, що символізують людиноцентричні метрики

  • Порівняння з людською продуктивністю
  • Розумна оцінка
Концепції Generative AI

Метрики для дискримінативних моделей

Вимірювання якості на чітко визначених завданнях

Переваги:

  • Широко прийняті та зрозумілі
  • Легко обчислювати й порівнювати

Недоліки:

  • Не охоплюють суб'єктивність згенерованого контенту

Дротики на мішені біля «яблучка».

Концепції Generative AI

Спеціальні метрики для генеративних моделей

Налаштовані під конкретні генеративні завдання

Переваги:

  • Тонкі критерії: реалістичність, різноманітність, новизна
  • Є багато відомих метрик

Недоліки:

  • Не охоплюють багато суб'єктивних елементів
  • Часто погано узагальнюються

Ілюстрації корів.

Концепції Generative AI

Порівняння з людською продуктивністю

 

Переваги:

  • Порівняння з людськими можливостями
  • Показує практичну придатність

Недоліки:

  • Нечесне порівняння

ШІ змагається з людиною.

Концепції Generative AI

ШІ, що здобувають нагороди

Людські змагання

Нагороджений твір, згенерований ШІ, із синьою стрічкою переможця

Людські стандартизовані тести

Графік результатів GPT-4 на багатьох стандартизованих тестах. Він перевершує більшість студентів у відомих тестах, як-от Uniform Bar Exam і GRE.

1 https://twitter.com/colostatefair/status/1565486317839863809, OpenAI
Концепції Generative AI

Золотий стандарт

Розумна оцінка людьми або іншими ШІ

Переваги:

  • Ураховує суб'єктивні аспекти

Недоліки:

  • Повільна, дорога й важко стандартизувати
  • Чутлива до людських упереджень і нерегулярності
Концепції Generative AI

Класичний тест Тюрінга

 

  • Запропоновано інформатиком Аланом Тюрінгом
  • Людський оцінювач судить контент, згенерований ШІ
  • Тест пройдено, якщо не відрізнити ШІ від людини
  • Але людська поведінка не завжди коректний еталон

Схема тесту Тюрінга: людський оцінювач, екран із контентом ШІ та людським контентом, процес відрізнення між ними.

Концепції Generative AI

Перейдемо до практики!

Концепції Generative AI

Preparing Video For Download...