RL फ्रेमवर्क नेविगेट करना

Python में Gymnasium के साथ Reinforcement Learning

Fouad Trad

Machine Learning Engineer

RL फ्रेमवर्क

एजेंट कंपोनेंट दिखाती इमेज.

Python में Gymnasium के साथ Reinforcement Learning

RL फ्रेमवर्क

एजेंट और एनवायरनमेंट कंपोनेंट दिखाती इमेज.

Python में Gymnasium के साथ Reinforcement Learning

RL फ्रेमवर्क

  • Agent: सीखने वाला, निर्णय लेने वाला
  • Environment: हल करने योग्य चुनौतियाँ

सभी RL कंपोनेंट्स: एजेंट, एनवायरनमेंट, स्टेट्स, एक्शंस, और रिवार्ड्स दिखाती इमेज.

Python में Gymnasium के साथ Reinforcement Learning

RL फ्रेमवर्क

  • Agent: सीखने वाला, निर्णय लेने वाला
  • Environment: हल करने योग्य चुनौतियाँ
  • State: दिए गए समय पर एनवायरनमेंट का स्नैपशॉट

एनवायरनमेंट एजेंट को स्टेट्स देता है, यह दिखाती इमेज.

Python में Gymnasium के साथ Reinforcement Learning

RL फ्रेमवर्क

  • Agent: सीखने वाला, निर्णय लेने वाला
  • Environment: हल करने योग्य चुनौतियाँ
  • State: दिए गए समय पर एनवायरनमेंट का स्नैपशॉट
  • Action: स्टेट के जवाब में एजेंट की पसंद

एजेंट, एनवायरनमेंट के स्टेट के जवाब में एक्शन करता है, यह दिखाती इमेज.

Python में Gymnasium के साथ Reinforcement Learning

RL फ्रेमवर्क

  • Agent: सीखने वाला, निर्णय लेने वाला
  • Environment: हल करने योग्य चुनौतियाँ
  • State: दिए गए समय पर एनवायरनमेंट का स्नैपशॉट
  • Action: स्टेट के जवाब में एजेंट की पसंद
  • Reward: एक्शन पर एजेंट को मिला फीडबैक

एजेंट स्टेट के जवाब में एक्शन करता है और उस पर एनवायरनमेंट से रिवार्ड पाता है, यह दिखाती इमेज.

Python में Gymnasium के साथ Reinforcement Learning

RL इंटरेक्शन लूप

env = create_environment()
state = env.get_initial_state()

for i in range(n_iterations): action = choose_action(state)
state, reward = env.execute(action)
update_knowledge(state, action, reward)

एजेंट स्टेट के जवाब में एक्शन करता है और उस पर एनवायरनमेंट से रिवार्ड पाता है, यह दिखाती इमेज.

Python में Gymnasium के साथ Reinforcement Learning

एपिसोडिक बनाम कंटीन्यूस टास्क्स

एपिसोडिक टास्क्स
  • टास्क्स एपिसोड्स में बाँटे जाते हैं
  • हर एपिसोड का आरंभ और अंत होता है
  • उदाहरण: एजेंट का शतरंज खेलना

शतरंज खेलती बिल्ली की इमेज.

कंटीन्यूस टास्क्स
  • निरंतर इंटरेक्शन
  • अलग-अलग एपिसोड नहीं
  • उदाहरण: ट्रैफिक लाइट्स समायोजित करना

साइकिल चलाता मेढक जो ग्रीन सिग्नल का इंतजार कर रहा है, यह इमेज.

Python में Gymnasium के साथ Reinforcement Learning

Return

  • एक्शंस के दूरगामी असर होते हैं
  • एजेंट समय के साथ कुल रिवार्ड अधिकतम करना चाहता है
  • Return: सभी अपेक्षित रिवार्ड्स का योग

रिटर्न r_1 से r_n तक व्यक्तिगत रिवार्ड्स के योग के रूप में दिखाती इमेज.

Python में Gymnasium के साथ Reinforcement Learning

Discounted return

  • तात्कालिक रिवार्ड भविष्य के रिवार्ड से अधिक मूल्यवान होते हैं
  • Discounted return: पास के रिवार्ड को अधिक वेट देता है
  • डिस्काउंट फैक्टर ($\gamma$): भविष्य के रिवार्ड्स को डिस्काउंट करता है

डिस्काउंटेड रिटर्न का सूत्र दिखाती इमेज, जहाँ हर रिवार्ड को डिस्काउंट फैक्टर की उपयुक्त घात से गुणा किया गया है.

Python में Gymnasium के साथ Reinforcement Learning

डिस्काउंट फैक्टर

  • zero और one के बीच
  • तात्कालिक बनाम दीर्घकालिक रिवार्ड्स का संतुलन
    • कम वैल्यू → तात्कालिक लाभ
    • अधिक वैल्यू → दीर्घकालिक फ़ायदे

डिस्काउंट फैक्टर के चरम मानों का प्रभाव दिखाती इमेज: zero पर केवल तात्कालिक लाभ, one पर भविष्य के लाभ बिना डिस्काउंट के.

Python में Gymnasium के साथ Reinforcement Learning

संख्यात्मक उदाहरण

import numpy as np
expected_rewards = np.array([1, 6, 3])

discount_factor = 0.9
discounts = np.array([discount_factor ** i for i in range(len(expected_rewards))])
print(f"Discounts: {discounts}")
Discounts: [1.   0.9  0.81]
discounted_return = np.sum(expected_rewards * discounts)
print(f"The discounted return is {discounted_return}")
The discounted return is 8.83
Python में Gymnasium के साथ Reinforcement Learning

अभ्यास करते हैं!

Python में Gymnasium के साथ Reinforcement Learning

Preparing Video For Download...