Основы обучения с подкреплением

Обучение с подкреплением с Gymnasium на Python

Fouad Trad

Machine Learning Engineer

Обучение с подкреплением

 

  • Агент учится методом проб и ошибок

 

Изображение с двумя иконками: агент и среда.

Обучение с подкреплением с Gymnasium на Python

Обучение с подкреплением

 

  • Агент учится методом проб и ошибок

 

Изображение: среда передаёт агенту наблюдения.

Обучение с подкреплением с Gymnasium на Python

Обучение с подкреплением

 

  • Агент учится методом проб и ошибок

 

Изображение: среда передаёт агенту наблюдения, а агент выполняет действия в ответ.

Обучение с подкреплением с Gymnasium на Python

Обучение с подкреплением

 

  • Агент учится методом проб и ошибок
  • Агент получает:
    • Награды за правильные решения
    • Штрафы за неправильные решения
  • Цель: максимизировать положительную обратную связь

 

Изображение: среда передаёт агенту наблюдения, агент выполняет действия и получает награды или штрафы.

Обучение с подкреплением с Gymnasium на Python

RL как дрессировка питомца

Изображение: пожилой человек (среда) обучает питомца (агента).

Обучение с подкреплением с Gymnasium на Python

RL vs. другие типы МО

Изображение: таблица с заголовком «Обучение с учителем», где указано, что используются размеченные данные, основная цель — прогнозирование результатов на основе входных данных, подходит для задач классификации и регрессии.

Обучение с подкреплением с Gymnasium на Python

RL vs. другие типы МО

Изображение: таблица, сравнивающая обучение с учителем и без учителя. Обучение с учителем: тип данных — размеченные данные, цель — прогнозирование результатов на основе входных данных, подходит для классификации и регрессии. Обучение без учителя: тип данных — неразмеченные данные, цель — поиск скрытых закономерностей и связей, подходит для кластеризации и анализа ассоциаций.

Обучение с подкреплением с Gymnasium на Python

RL vs. другие типы МО

Изображение: таблица, расширенная для сравнения RL с обучением с учителем и без учителя. Обучение с учителем использует размеченные данные для прогнозирования результатов, подходит для классификации и регрессии. Обучение без учителя использует неразмеченные данные для поиска закономерностей, подходит для кластеризации и анализа ассоциаций. RL не требует заранее подготовленных обучающих данных и нацелено на принятие решений, максимизирующих награды от среды, подходит для задач принятия решений.

Обучение с подкреплением с Gymnasium на Python

Когда применять RL?

 

  • Последовательное принятие решений
    • Решения влияют на будущие наблюдения
  • Обучение через награды и штрафы
    • Без прямого контроля

Иконка робота

Обучение с подкреплением с Gymnasium на Python

Подходит для RL: игры

  • Игрок принимает последовательные решения
  • Получает очки и теряет жизни в зависимости от действий

Изображение: сцена из видеоигры, где агент принимает решение.

Обучение с подкреплением с Gymnasium на Python

Не подходит для RL: распознавание объектов в игре

  • Нет последовательного принятия решений
  • Нет взаимодействия со средой

Изображение: кадр из игры, где нужно распознавать разных покемонов.

Обучение с подкреплением с Gymnasium на Python

Применение RL

Робототехника
  • Ходьба робота
  • Манипуляция объектами

Изображение руки робота.

Обучение с подкреплением с Gymnasium на Python

Применение RL

Робототехника
  • Ходьба робота
  • Манипуляция объектами

Изображение руки робота.

Финансы
  • Оптимизация торговли и инвестиций
  • Максимизация прибыли

Изображение: из открытого портфеля вылетают деньги на синем фоне — символ финансового успеха.

Обучение с подкреплением с Gymnasium на Python

Применение RL

Автономные транспортные средства
  • Повышение безопасности и эффективности
  • Снижение риска аварий

Изображение: несколько автономных автомобилей на дороге.

Обучение с подкреплением с Gymnasium на Python

Применение RL

Автономные транспортные средства
  • Повышение безопасности и эффективности
  • Снижение риска аварий

Изображение: несколько автономных автомобилей на дороге.

Разработка чат-ботов
  • Улучшение навыков диалога
  • Повышение качества пользовательского опыта

Изображение диалогового чат-бота.

Обучение с подкреплением с Gymnasium на Python

Что дальше?

В этом курсе мы:

  • Изучим основы и принципы RL
  • Научимся выявлять, формулировать и решать задачи RL
  • Применим знания с помощью Gymnasium

Логотип Gymnasium.

Обучение с подкреплением с Gymnasium на Python

Давайте потренируемся!

Обучение с подкреплением с Gymnasium на Python

Preparing Video For Download...