強化學習基礎
使用 Python 的 Gymnasium 進行強化學習
Fouad Trad
Machine Learning Engineer
強化學習
代理透過嘗試與錯誤學習
強化學習
代理透過嘗試與錯誤學習
強化學習
代理透過嘗試與錯誤學習
強化學習
代理透過嘗試與錯誤學習
代理會收到:
正確決策得獎勵
錯誤決策受懲罰
目標
:隨時間最大化正向回饋
把 RL 想成訓練寵物
RL 與其他 ML 類型比較
RL 與其他 ML 類型比較
RL 與其他 ML 類型比較
何時使用 RL?
序列式決策
決策會影響未來觀測
透過獎懲學習
無直接監督
適合 RL:玩電玩
玩家需做連續決策
依動作獲得分數、失去生命
不適合 RL:遊戲內物件辨識
無序列式決策
無與環境互動
RL 應用
機器人
機器人行走
物件操控
RL 應用
機器人
機器人行走
物件操控
金融
最佳化交易與投資
追求利潤最大化
RL 應用
自駕車
提升安全與效率
降低事故風險
RL 應用
自駕車
提升安全與效率
降低事故風險
聊天機器人開發
強化對話能力
改善使用者體驗
下一步是什麼?
本課程你將:
理解 RL 的基礎與原理
辨識、定義並解決 RL 問題
使用 Gymnasium 實作應用
一起來練習吧!
使用 Python 的 Gymnasium 進行強化學習
Preparing Video For Download...