Основи навчання з підкріпленням
Reinforcement Learning з Gymnasium у Python
Fouad Trad
Machine Learning Engineer
Навчання з підкріпленням
Агент навчається методом спроб і помилок
Навчання з підкріпленням
Агент навчається методом спроб і помилок
Навчання з підкріпленням
Агент навчається методом спроб і помилок
Навчання з підкріпленням
Агент навчається методом спроб і помилок
Агент отримує:
Винагороди за вдалі рішення
Штрафи за хибні рішення
Мета
: максимально збільшити позитивний зворотний зв'язок з часом
RL як дресирування улюбленця
RL vs інші типи ML
RL vs інші типи ML
RL vs інші типи ML
Коли варто використовувати RL?
Послідовне ухвалення рішень
Рішення впливають на майбутні спостереження
Навчання через винагороди та штрафи
Без прямого нагляду
Доречно для RL: гра в відеоігри
Гравець послідовно ухвалює рішення
Отримує бали й втрачає життя залежно від дій
Недоречно для RL: розпізнавання об'єктів у грі
Немає послідовного ухвалення рішень
Немає взаємодії із середовищем
Застосування RL
Робототехніка
Ходіння робота
Маніпуляція об'єктами
Застосування RL
Робототехніка
Ходіння робота
Маніпуляція об'єктами
Фінанси
Оптимізація трейдингу та інвестування
Максимізація прибутку
Застосування RL
Автономні транспортні засоби
Підвищення безпеки та ефективності
Зменшення ризику аварій
Застосування RL
Автономні транспортні засоби
Підвищення безпеки та ефективності
Зменшення ризику аварій
Розробка чатботів
Поліпшення розмовних навичок
Кращий досвід користувачів
Що далі?
У цьому курсі ви:
Розберетеся з основами та принципами RL
Навчитеся визначати, формулювати й розв'язувати задачі RL
Попрактикуєтесь із Gymnasium
Давайте потренуємось!
Reinforcement Learning з Gymnasium у Python
Preparing Video For Download...