強化學習基礎

使用 Python 的 Gymnasium 進行強化學習

Fouad Trad

Machine Learning Engineer

強化學習

 

  • 代理透過嘗試與錯誤學習

 

顯示兩個圖示的圖片,一個代表代理,另一個代表環境。

使用 Python 的 Gymnasium 進行強化學習

強化學習

 

  • 代理透過嘗試與錯誤學習

 

圖片顯示環境將觀測提供給代理。

使用 Python 的 Gymnasium 進行強化學習

強化學習

 

  • 代理透過嘗試與錯誤學習

 

圖片顯示環境提供代理觀測,接著代理據此採取動作。

使用 Python 的 Gymnasium 進行強化學習

強化學習

 

  • 代理透過嘗試與錯誤學習
  • 代理會收到:
    • 正確決策得獎勵
    • 錯誤決策受懲罰
  • 目標:隨時間最大化正向回饋

 

圖片顯示環境提供代理觀測,代理採取動作,並依動作獲得獎勵或懲罰。

使用 Python 的 Gymnasium 進行強化學習

把 RL 想成訓練寵物

圖片顯示一位老人(環境)在訓練寵物(代理)。

使用 Python 的 Gymnasium 進行強化學習

RL 與其他 ML 類型比較

圖片為標示「監督式學習」的表格,指出資料型態為有標籤資料,主要目標是依輸入資料預測結果,適用於分類與迴歸。

使用 Python 的 Gymnasium 進行強化學習

RL 與其他 ML 類型比較

圖片為監督式學習與非監督式學習的比較表。監督式學習:資料型態為有標籤資料,主要目標是依輸入預測結果,適用於分類與迴歸。非監督式學習:資料型態為無標籤資料,主要目標是發掘資料中的模式或關聯,適用於分群與關聯分析。

使用 Python 的 Gymnasium 進行強化學習

RL 與其他 ML 類型比較

圖片為延伸比較表,加入 RL 與監督式、非監督式學習。監督式學習用有標籤資料做預測,適用分類與迴歸。非監督式學習用無標籤資料找出模式或關聯,適用分群與關聯分析。RL 不需預先定義訓練資料,重點在做出能從環境獲得最高獎勵的決策,適用於決策任務。

使用 Python 的 Gymnasium 進行強化學習

何時使用 RL?

 

  • 序列式決策
    • 決策會影響未來觀測
  • 透過獎懲學習
    • 無直接監督

機器人圖示

使用 Python 的 Gymnasium 進行強化學習

適合 RL:玩電玩

  • 玩家需做連續決策
  • 依動作獲得分數、失去生命

圖片顯示電玩場景,代理正在做決策。

使用 Python 的 Gymnasium 進行強化學習

不適合 RL:遊戲內物件辨識

  • 無序列式決策
  • 無與環境互動

圖片顯示電玩畫面,目標是辨識不同種類的寶可夢。

使用 Python 的 Gymnasium 進行強化學習

RL 應用

機器人
  • 機器人行走
  • 物件操控

圖片顯示機器人手。

使用 Python 的 Gymnasium 進行強化學習

RL 應用

機器人
  • 機器人行走
  • 物件操控

圖片顯示機器人手。

金融
  • 最佳化交易與投資
  • 追求利潤最大化

圖片描繪大量鈔票從打開的公事包中飛出,藍色背景,表現財務成功概念。

使用 Python 的 Gymnasium 進行強化學習

RL 應用

自駕車
  • 提升安全與效率
  • 降低事故風險

圖片顯示多輛自駕車在道路上行駛。

使用 Python 的 Gymnasium 進行強化學習

RL 應用

自駕車
  • 提升安全與效率
  • 降低事故風險

圖片顯示多輛自駕車在道路上行駛。

聊天機器人開發
  • 強化對話能力
  • 改善使用者體驗

圖片顯示一個對話式聊天機器人。

使用 Python 的 Gymnasium 進行強化學習

下一步是什麼?

本課程你將:

  • 理解 RL 的基礎與原理
  • 辨識、定義並解決 RL 問題
  • 使用 Gymnasium 實作應用

Gymnasium 標誌圖片。

使用 Python 的 Gymnasium 進行強化學習

一起來練習吧!

使用 Python 的 Gymnasium 進行強化學習

Preparing Video For Download...