Оценка модели

Концепции генеративного ИИ

Daniel Tedesco

Data Lead, Google

Зачем проводить оценку?

Оценка производительности и эффективности модели:

  • Измерение прогресса
  • Строгое сравнение моделей
  • Сравнение с человеческими показателями
Концепции генеративного ИИ

Оценка генеративного ИИ

Количественные метрики

Числа, представляющие количественные метрики

  • Метрики оценки дискриминативных моделей
  • Специфические метрики генеративных моделей

Антропоцентрические метрики

Пузыри диалога, представляющие антропоцентрические метрики

  • Сравнение с показателями человека
  • Интеллектуальная оценка
Концепции генеративного ИИ

Методы оценки дискриминативных моделей

Измерение производительности на чётко определённых задачах

Плюсы:

  • Широко приняты и понятны
  • Легко вычислить и сравнить

Минусы:

  • Не отражают субъективный характер сгенерированного контента

Мишень с дротиками вблизи центра.

Концепции генеративного ИИ

Специфические метрики генеративных моделей

Адаптированы для конкретных генеративных задач

Плюсы:

  • Детальные критерии: реалистичность, разнообразие, новизна
  • Множество известных метрик

Минусы:

  • Не улавливают многие субъективные аспекты
  • Зачастую не обобщаются

Иллюстрации коров.

Концепции генеративного ИИ

Сравнение с показателями человека

 

Плюсы:

  • Сравнение с возможностями человека
  • Демонстрирует практическую применимость

Минусы:

  • Сравнение не всегда корректно

ИИ соревнуется с человеком.

Концепции генеративного ИИ

ИИ-победители

Соревнования с участием людей

Произведение искусства, созданное ИИ и завоевавшее первый приз с голубой лентой

Стандартизированные тесты для людей

График результатов GPT-4 на нескольких стандартизированных тестах. Модель превосходит большинство студентов на таких экзаменах, как Uniform Bar Exam и GRE.

1 https://twitter.com/colostatefair/status/1565486317839863809, OpenAI
Концепции генеративного ИИ

Золотой стандарт

Интеллектуальная оценка людьми или другими ИИ

Плюсы:

  • Учитывает субъективные аспекты

Минусы:

  • Медленно, дорого и сложно стандартизировать
  • Подвержена человеческим предубеждениям и непоследовательности
Концепции генеративного ИИ

Классический тест Тьюринга

 

  • Предложен учёным-информатиком Аланом Тьюрингом
  • Человек-оценщик анализирует контент, созданный ИИ
  • Тест пройден, если оценщик не отличает ИИ от человека
  • Однако поведение человека — не всегда верный эталон

Схема теста Тьюринга: человек-оценщик, экран с контентом ИИ и контент, созданный человеком — иллюстрация процесса различения двух источников.

Концепции генеративного ИИ

Давайте потренируемся!

Концепции генеративного ИИ

Preparing Video For Download...