強化学習の基礎
Pythonで学ぶGymnasiumによるReinforcement Learning
Fouad Trad
Machine Learning Engineer
強化学習
エージェントは試行錯誤で学習
強化学習
エージェントは試行錯誤で学習
強化学習
エージェントは試行錯誤で学習
強化学習
エージェントは試行錯誤で学習
エージェントは受け取る:
良い行動への報酬
悪い行動への罰則
目的
:時間を通じて正のフィードバックを最大化
ペット訓練としてのRL
RLと他のMLの違い
RLと他のMLの違い
RLと他のMLの違い
RLの適用場面
逐次的な意思決定
決定が将来の観測に影響
報酬と罰則による学習
直接の教師なし
RLに適する例:ビデオゲーム
プレイヤーは連続して意思決定
行動で得点やライフ減少が変化
RLに不適:ゲーム内の物体認識
逐次的な意思決定なし
環境との相互作用なし
RLの応用
ロボティクス
歩行制御
物体操作
RLの応用
ロボティクス
歩行制御
物体操作
ファイナンス
取引・投資の最適化
利益の最大化
RLの応用
自動運転車
安全性と効率の向上
事故リスクの最小化
RLの応用
自動運転車
安全性と効率の向上
事故リスクの最小化
チャットボット開発
会話スキルの強化
ユーザー体験の向上
次は何を学ぶか
このコースで学ぶこと
RLの基礎と原理を理解
RL課題の特定・定式化・解法を習得
Gymnasiumで実装
練習しましょう!
Pythonで学ぶGymnasiumによるReinforcement Learning
Preparing Video For Download...