Markov Decision Processes

Python में Gymnasium के साथ Reinforcement Learning

Fouad Trad

Machine Learning Engineer

MDP

  • RL एन्वायरनमेंट्स का गणितीय मॉडल बनाता है

एक जटिल एन्वायरनमेंट (स्मार्ट सिटी) और उससे निकाले जाने वाले घटक: states, actions, rewards, और transition probabilities।

Python में Gymnasium के साथ Reinforcement Learning

MDP

  • RL एन्वायरनमेंट्स का गणितीय मॉडल बनाता है

डायग्राम दिखाता है कि जटिल एन्वायरनमेंट से हम MDP के घटक (states, actions, rewards, और transition probabilities) निकालते हैं ताकि model-based RL तकनीकों से समस्या हल करें।

Python में Gymnasium के साथ Reinforcement Learning

Markov property

  • भविष्य का state केवल वर्तमान state और action पर निर्भर है

शतरंज बोर्ड, संभावित चालों के तीरों के साथ।

Python में Gymnasium के साथ Reinforcement Learning

Frozen Lake as MDP

  • एजेंट को छेदों में गिरे बिना लक्ष्य तक पहुँचना है

फ्रोज़न लेक एन्वायरनमेंट।

Python में Gymnasium के साथ Reinforcement Learning

Frozen Lake as MDP - states

  • वे पोजीशन्स जहाँ एजेंट हो सकता है

फ्रोज़न लेक में एजेंट की तीन अलग पोजीशन्स।

Python में Gymnasium के साथ Reinforcement Learning

Frozen Lake as MDP - terminal states

  • एपिसोड समाप्त कर देते हैं

फ्रोज़न लेक में टर्मिनल states।

Python में Gymnasium के साथ Reinforcement Learning

Frozen Lake as MDP - actions

  • ऊपर, नीचे, बाएँ, दाएँ

फ्रोज़न लेक में actions और उनके लेबल: 0-left, 1-down, 2-right, 3-up.

Python में Gymnasium के साथ Reinforcement Learning

Frozen Lake as MDP - transitions

  • Actions हमेशा अपेक्षित परिणाम तक नहीं पहुँचाते

एजेंट ग्रिड के टॉप-लेफ्ट में है और दाएँ जाना चाहता है।

Python में Gymnasium के साथ Reinforcement Learning

Frozen Lake as MDP - transitions

  • Actions हमेशा अपेक्षित परिणाम तक नहीं पहुँचाते

एजेंट दाएँ जा सकता है।

Python में Gymnasium के साथ Reinforcement Learning

Frozen Lake as MDP - transitions

  • Actions हमेशा अपेक्षित परिणाम तक नहीं पहुँचाते

एजेंट नीचे भी जा सकता है।

Python में Gymnasium के साथ Reinforcement Learning

Frozen Lake as MDP - transitions

  • Actions हमेशा अपेक्षित परिणाम तक नहीं पहुँचाते

कभी-कभी एजेंट वहीं रह सकता है।

Python में Gymnasium के साथ Reinforcement Learning

Frozen Lake as MDP - transitions

  • Actions हमेशा अपेक्षित परिणाम तक नहीं पहुँचाते

जब एजेंट दाएँ जाने का निर्णय लेता है, तो दाएँ, नीचे जाने या वहीं रहने की probabilities होती हैं।

  • Transition probabilities: किसी state और action के दिए जाने पर किसी state तक पहुँचने की संभावना
Python में Gymnasium के साथ Reinforcement Learning

Frozen Lake as MDP - rewards

  • रिवॉर्ड केवल goal state में मिलता है

एजेंट goal state में।

Python में Gymnasium के साथ Reinforcement Learning

Gymnasium states and actions

import gymnasium as gym


env = gym.make('FrozenLake', is_slippery=True)
print(env.action_space)
print(env.observation_space)
print("Number of actions: ", env.action_space.n)
print("Number of states: ", env.observation_space.n)
Discrete(4)

Discrete(16)
Number of actions: 4
Number of states: 16
Python में Gymnasium के साथ Reinforcement Learning

Gymnasium rewards and transitions

env.unwrapped.P: डिक्शनरी, जिसमें keys state-action पेयर्स होते हैं

print(env.unwrapped.P[state][action])
[
  (probability_1, next_state_1, reward_1, is_terminal_1), 
  (probability_2, next_state_2, reward_2, is_terminal_2), 
  etc.
]
Python में Gymnasium के साथ Reinforcement Learning

Gymnasium rewards and transitions - उदाहरण

state = 6
action = 0

print(env.unwrapped.P[state][action])
[(0.3333333333333333, 2, 0.0, False), 
(0.3333333333333333, 5, 0.0, True), 
(0.3333333333333333, 10, 0.0, False)]

एक्शन नंबर: 0-left, 1-down, 2-right, 3-up.

एजेंट state नंबर 6 में है; states ऊपर-बाएँ से नीचे-दाएँ तक लाइन-बाय-라인 नंबर किए गए हैं।

Python में Gymnasium के साथ Reinforcement Learning

अभ्यास करते हैं!

Python में Gymnasium के साथ Reinforcement Learning

Preparing Video For Download...