强化学习基础

Python 中的 Gymnasium 强化学习

Fouad Trad

Machine Learning Engineer

强化学习

 

  • 代理通过试错学习

 

图片显示两个图标:一个代表代理,另一个代表环境。

Python 中的 Gymnasium 强化学习

强化学习

 

  • 代理通过试错学习

 

图片显示环境向代理提供观测。

Python 中的 Gymnasium 强化学习

强化学习

 

  • 代理通过试错学习

 

图片显示环境向代理提供观测,代理据此执行动作。

Python 中的 Gymnasium 强化学习

强化学习

 

  • 代理通过试错学习
  • 代理会收到:
    • 正确决策获奖励
    • 错误决策受惩罚
  • 目标:长期最大化正向反馈

 

展示环境向代理提供观测,代理执行动作,并据此获得奖励或惩罚的图片。

Python 中的 Gymnasium 强化学习

把RL类比为训练宠物

图片展示一位老人(环境)训练宠物(代理)。

Python 中的 Gymnasium 强化学习

RL vs. 其他ML类型

图片为题为"监督学习"的表格:数据为有标签,目标是基于输入预测结果,适用于分类和回归。

Python 中的 Gymnasium 强化学习

RL vs. 其他ML类型

图片比较监督学习与无监督学习。监督学习:有标签数据,目标是基于输入预测结果,适用于分类与回归。无监督学习:无标签数据,目标是发现模式或关联,适用于聚类与关联分析。

Python 中的 Gymnasium 强化学习

RL vs. 其他ML类型

图片展示含RL的扩展比较表:监督学习用有标签数据做预测,适用于分类与回归;无监督学习用无标签数据挖掘模式或关联,适用于聚类与关联分析;RL不需预定义训练数据,专注做出最大化来自环境奖励的决策,适用于决策任务。

Python 中的 Gymnasium 强化学习

何时使用RL?

 

  • 序列决策
    • 决策影响未来观测
  • 通过奖励与惩罚学习
    • 无直接监督

机器人图标

Python 中的 Gymnasium 强化学习

适合RL:玩电子游戏

  • 玩家进行序列决策
  • 根据动作得分或失去生命

图片显示电子游戏场景,代理正在决策。

Python 中的 Gymnasium 强化学习

不适合RL:游戏内目标识别

  • 无序列决策
  • 不与环境交互

图片显示游戏画面,目标是识别不同宝可梦。

Python 中的 Gymnasium 强化学习

RL应用

机器人
  • 机器人行走
  • 物体操作

图片显示机器人手。

Python 中的 Gymnasium 强化学习

RL应用

机器人
  • 机器人行走
  • 物体操作

图片显示机器人手。

金融
  • 优化交易与投资
  • 利润最大化

图片展示大量金钱从公文包中飞出,寓意财务成功。

Python 中的 Gymnasium 强化学习

RL应用

自动驾驶
  • 提升安全与效率
  • 降低事故风险

图片显示多辆自动驾驶汽车在路上行驶。

Python 中的 Gymnasium 强化学习

RL应用

自动驾驶
  • 提升安全与效率
  • 降低事故风险

图片显示多辆自动驾驶汽车在路上行驶。

聊天机器人开发
  • 增强对话能力
  • 改善用户体验

图片显示一个对话式聊天机器人。

Python 中的 Gymnasium 强化学习

接下来做什么?

本课程将:

  • 理解RL的基础与原理
  • 识别、建模并解决RL问题
  • 使用Gymnasium实现应用

Gymnasium标志图片。

Python 中的 Gymnasium 强化学习

Vamos praticar!

Python 中的 Gymnasium 强化学习

Preparing Video For Download...