Grunderna i förstärkningsinlärning

Reinforcement Learning med Gymnasium i Python

Fouad Trad

Machine Learning Engineer

Förstärkningsinlärning

 

  • Agenten lär sig genom försök och misstag

 

Bild med två ikoner, en för en agent och en för miljön.

Reinforcement Learning med Gymnasium i Python

Förstärkningsinlärning

 

  • Agenten lär sig genom försök och misstag

 

Bild som visar att miljön skickar observationer till agenten.

Reinforcement Learning med Gymnasium i Python

Förstärkningsinlärning

 

  • Agenten lär sig genom försök och misstag

 

Bild som visar att miljön ger agenten observationer, och att agenten sedan utför åtgärder utifrån dessa.

Reinforcement Learning med Gymnasium i Python

Förstärkningsinlärning

 

  • Agenten lär sig genom försök och misstag
  • Agenten får:
    • Belöningar för bra beslut
    • Straff för dåliga beslut
  • Mål: maximera positiv feedback över tid

 

Bild som visar att miljön ger agenten observationer, att agenten utför åtgärder och sedan tar emot belöningar eller straff baserat på dessa åtgärder.

Reinforcement Learning med Gymnasium i Python

RL som husdjursträning

Bild som visar en äldre man (miljön) som tränar ett husdjur (agenten).

Reinforcement Learning med Gymnasium i Python

RL vs. andra ML-typer

Bilden visar en tabell med rubriken "Övervakad inlärning" som anger att datatypen är märkt data, att huvudmålet är att förutsäga utfall baserat på indata och att den lämpar sig för klassificering och regression.

Reinforcement Learning med Gymnasium i Python

RL vs. andra ML-typer

Bilden visar en tabell som jämför övervakad inlärning och oövervakad inlärning. För övervakad inlärning: datatypen är märkt data, huvudmålet är att förutsäga utfall baserat på indata och den lämpar sig för klassificering och regression. För oövervakad inlärning: datatypen är omärkt data, huvudmålet är att hitta underliggande mönster eller samband i data och den lämpar sig för klustring och associationsanalys.

Reinforcement Learning med Gymnasium i Python

RL vs. andra ML-typer

Bilden visar en tabell som utökar jämförelsen med RL bredvid övervakad och oövervakad inlärning. Övervakad inlärning använder märkt data för att förutsäga utfall och lämpar sig för klassificering och regression. Oövervakad inlärning använder omärkt data för att hitta mönster eller samband och lämpar sig för klustring och associationsanalys. RL kräver ingen fördefinierad träningsdata och fokuserar på att fatta beslut som maximerar belöningar från miljön, lämplig för beslutsfattandeuppgifter.

Reinforcement Learning med Gymnasium i Python

När ska RL användas?

 

  • Sekventiellt beslutsfattande
    • Beslut påverkar framtida observationer
  • Inlärning via belöningar och straff
    • Ingen direkt övervakning

Ikon för en robot

Reinforcement Learning med Gymnasium i Python

Lämpligt för RL: tv-spel

  • Spelaren fattar sekventiella beslut
  • Får poäng och förlorar liv beroende på sina handlingar

Bild som visar en scen från ett tv-spel där agenten fattar ett beslut.

Reinforcement Learning med Gymnasium i Python

Olämpligt för RL: objektigenkänning i spel

  • Inget sekventiellt beslutsfattande
  • Ingen interaktion med en miljö

Bild som visar en spelintern ram där målet är att känna igen olika sorters pokémons.

Reinforcement Learning med Gymnasium i Python

RL-tillämpningar

Robotik
  • Robot som går
  • Objektmanipulation

Bild som visar en robothand.

Reinforcement Learning med Gymnasium i Python

RL-tillämpningar

Robotik
  • Robot som går
  • Objektmanipulation

Bild som visar en robothand.

Finans
  • Optimering av handel och investeringar
  • Maximera vinst

Bild som föreställer en stor mängd pengar som flyger ur en öppen portfölj mot en blå bakgrund, vilket symboliserar ekonomisk framgång.

Reinforcement Learning med Gymnasium i Python

RL-tillämpningar

Autonoma fordon
  • Förbättrad säkerhet och effektivitet
  • Minimering av olycksrisker

Bild som visar flera autonoma fordon på vägen.

Reinforcement Learning med Gymnasium i Python

RL-tillämpningar

Autonoma fordon
  • Förbättrad säkerhet och effektivitet
  • Minimering av olycksrisker

Bild som visar flera autonoma fordon på vägen.

Chatbot-utveckling
  • Förbättrade konversationsfärdigheter
  • Bättre användarupplevelser

Bild som visar en konversationsbaserad chatbot.

Reinforcement Learning med Gymnasium i Python

Vad händer härnäst?

I den här kursen:

  • Förstå RL:s grunder och principer
  • Identifiera, formulera och lösa RL-problem
  • Tillämpning med Gymnasium

Bild för Gymnasium-logotypen.

Reinforcement Learning med Gymnasium i Python

Nu kör vi en övning!

Reinforcement Learning med Gymnasium i Python

Preparing Video For Download...