强化学习基础
Python 中的 Gymnasium 强化学习
Fouad Trad
Machine Learning Engineer
强化学习
代理通过试错学习
强化学习
代理通过试错学习
强化学习
代理通过试错学习
强化学习
代理通过试错学习
代理会收到:
正确决策获奖励
错误决策受惩罚
目标:长期最大化正向反馈
把RL类比为训练宠物
RL vs. 其他ML类型
RL vs. 其他ML类型
RL vs. 其他ML类型
何时使用RL?
序列决策
决策影响未来观测
通过奖励与惩罚学习
无直接监督
适合RL:玩电子游戏
玩家进行序列决策
根据动作得分或失去生命
不适合RL:游戏内目标识别
无序列决策
不与环境交互
RL应用
机器人
机器人行走
物体操作
RL应用
机器人
机器人行走
物体操作
金融
优化交易与投资
利润最大化
RL应用
自动驾驶
提升安全与效率
降低事故风险
RL应用
自动驾驶
提升安全与效率
降低事故风险
聊天机器人开发
增强对话能力
改善用户体验
接下来做什么?
本课程将:
理解RL的基础与原理
识别、建模并解决RL问题
使用Gymnasium实现应用
Vamos praticar!
Python 中的 Gymnasium 强化学习
Preparing Video For Download...