Основы обучения с подкреплением
Обучение с подкреплением с Gymnasium на Python
Fouad Trad
Machine Learning Engineer
Обучение с подкреплением
Агент учится методом проб и ошибок
Обучение с подкреплением
Агент учится методом проб и ошибок
Обучение с подкреплением
Агент учится методом проб и ошибок
Обучение с подкреплением
Агент учится методом проб и ошибок
Агент получает:
Награды за правильные решения
Штрафы за неправильные решения
Цель
: максимизировать положительную обратную связь
RL как дрессировка питомца
RL vs. другие типы МО
RL vs. другие типы МО
RL vs. другие типы МО
Когда применять RL?
Последовательное принятие решений
Решения влияют на будущие наблюдения
Обучение через награды и штрафы
Без прямого контроля
Подходит для RL: игры
Игрок принимает последовательные решения
Получает очки и теряет жизни в зависимости от действий
Не подходит для RL: распознавание объектов в игре
Нет последовательного принятия решений
Нет взаимодействия со средой
Применение RL
Робототехника
Ходьба робота
Манипуляция объектами
Применение RL
Робототехника
Ходьба робота
Манипуляция объектами
Финансы
Оптимизация торговли и инвестиций
Максимизация прибыли
Применение RL
Автономные транспортные средства
Повышение безопасности и эффективности
Снижение риска аварий
Применение RL
Автономные транспортные средства
Повышение безопасности и эффективности
Снижение риска аварий
Разработка чат-ботов
Улучшение навыков диалога
Повышение качества пользовательского опыта
Что дальше?
В этом курсе мы:
Изучим основы и принципы RL
Научимся выявлять, формулировать и решать задачи RL
Применим знания с помощью Gymnasium
Давайте потренируемся!
Обучение с подкреплением с Gymnasium на Python
Preparing Video For Download...