Základy zpětnovazebního učení
Reinforcement Learning with Gymnasium in Python
Fouad Trad
Machine Learning Engineer
Zpětnovazební učení
Agent se učí metodou pokus a omyl
Zpětnovazební učení
Agent se učí metodou pokus a omyl
Zpětnovazební učení
Agent se učí metodou pokus a omyl
Zpětnovazební učení
Agent se učí metodou pokus a omyl
Agent přijímá:
Odměny za správná rozhodnutí
Penalizace za špatná rozhodnutí
Cíl
: maximalizovat pozitivní zpětnou vazbu
RL jako trénování domácího mazlíčka
RL vs. ostatní typy ML
RL vs. ostatní typy ML
RL vs. ostatní typy ML
Kdy použít RL?
Sekvenční rozhodování
Rozhodnutí ovlivňují budoucí pozorování
Učení prostřednictvím odměn a penalizací
Bez přímého dohledu
Vhodné pro RL: hraní videoher
Hráč přijímá sekvenční rozhodnutí
Získává body nebo ztrácí životy podle akcí
Nevhodné pro RL: rozpoznávání objektů ve hře
Žádné sekvenční rozhodování
Žádná interakce s prostředím
Aplikace RL
Robotika
Chůze robota
Manipulace s objekty
Aplikace RL
Robotika
Chůze robota
Manipulace s objekty
Finance
Optimalizace obchodování a investic
Maximalizace zisku
Aplikace RL
Autonomní vozidla
Zvýšení bezpečnosti a efektivity
Minimalizace rizika nehod
Aplikace RL
Autonomní vozidla
Zvýšení bezpečnosti a efektivity
Minimalizace rizika nehod
Vývoj chatbotů
Zlepšení konverzačních schopností
Zlepšení uživatelského zážitku
Co nás čeká?
V tomto kurzu:
Porozumění základům a principům RL
Identifikace, formulace a řešení úloh RL
Aplikace s Gymnasium
Pojďme si to procvičit!
Reinforcement Learning with Gymnasium in Python
Preparing Video For Download...