Podstawy uczenia ze wzmocnieniem

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Fouad Trad

Machine Learning Engineer

Uczenie ze wzmocnieniem

 

  • Agent uczy się metodą prób i błędów

 

Obraz pokazujący dwie ikony: jedną dla agenta i jedną dla środowiska.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Uczenie ze wzmocnieniem

 

  • Agent uczy się metodą prób i błędów

 

Obraz pokazujący, że obserwacje są przekazywane ze środowiska do agenta.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Uczenie ze wzmocnieniem

 

  • Agent uczy się metodą prób i błędów

 

Obraz pokazujący, że środowisko dostarcza agentowi obserwacje, a następnie agent wykonuje odpowiednie działania.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Uczenie ze wzmocnieniem

 

  • Agent uczy się metodą prób i błędów
  • Agent otrzymuje:
    • Nagrody za dobre decyzje
    • Kary za złe decyzje
  • Cel: maksymalizacja pozytywnych sygnałów w czasie

 

Obraz pokazujący, że środowisko dostarcza agentowi obserwacje, agent wykonuje działania i otrzymuje nagrody lub kary.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

RL jako tresowanie zwierzęcia

Obraz przedstawiający starszego mężczyznę (środowisko) trenującego zwierzę domowe (agenta).

Uczenie przez wzmacnianie z Gymnasium w Pythonie

RL a inne typy ML

Obraz przedstawia tabelę z nagłówkiem „Uczenie nadzorowane", zawierającą informacje o typie danych (dane etykietowane), celu (przewidywanie wyników na podstawie danych wejściowych) oraz zastosowaniach (klasyfikacja i regresja).

Uczenie przez wzmacnianie z Gymnasium w Pythonie

RL a inne typy ML

Obraz przedstawia tabelę porównującą uczenie nadzorowane i nienadzorowane. Uczenie nadzorowane: dane etykietowane, cel – przewidywanie wyników, zastosowania – klasyfikacja i regresja. Uczenie nienadzorowane: dane bez etykiet, cel – odkrywanie wzorców i zależności, zastosowania – grupowanie i analiza asocjacji.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

RL a inne typy ML

Obraz przedstawia tabelę rozszerzoną o RL obok uczenia nadzorowanego i nienadzorowanego. Uczenie nadzorowane: dane etykietowane, przewidywanie wyników, klasyfikacja i regresja. Uczenie nienadzorowane: dane bez etykiet, odkrywanie wzorców, grupowanie i analiza asocjacji. RL: nie wymaga predefiniowanych danych treningowych, skupia się na podejmowaniu decyzji maksymalizujących nagrody ze środowiska, zastosowania – zadania decyzyjne.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Kiedy stosować RL?

 

  • Sekwencyjne podejmowanie decyzji
    • Decyzje wpływają na przyszłe obserwacje
  • Uczenie przez nagrody i kary
    • Brak bezpośredniego nadzoru

Ikona robota

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Odpowiednie dla RL: gry wideo

  • Gracz podejmuje sekwencyjne decyzje
  • Zdobywa punkty i traci życia w zależności od działań

Obraz przedstawiający scenę z gry wideo, w której agent podejmuje decyzję.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Nieodpowiednie dla RL: rozpoznawanie obiektów w grze

  • Brak sekwencyjnego podejmowania decyzji
  • Brak interakcji ze środowiskiem

Obraz przedstawiający kadr z gry, w którym celem jest rozpoznawanie różnych rodzajów pokemonów.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Zastosowania RL

Robotyka
  • Chodzenie robota
  • Manipulacja obiektami

Obraz przedstawiający ramię robotyczne.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Zastosowania RL

Robotyka
  • Chodzenie robota
  • Manipulacja obiektami

Obraz przedstawiający ramię robotyczne.

Finanse
  • Optymalizacja handlu i inwestycji
  • Maksymalizacja zysku

Obraz przedstawiający dużą sumę pieniędzy wylatującą z otwartej teczki na niebieskim tle, symbolizującą sukces finansowy.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Zastosowania RL

Pojazdy autonomiczne
  • Poprawa bezpieczeństwa i efektywności
  • Minimalizacja ryzyka wypadków

Obraz przedstawiający kilka pojazdów autonomicznych jadących po drodze.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Zastosowania RL

Pojazdy autonomiczne
  • Poprawa bezpieczeństwa i efektywności
  • Minimalizacja ryzyka wypadków

Obraz przedstawiający kilka pojazdów autonomicznych jadących po drodze.

Tworzenie chatbotów
  • Doskonalenie umiejętności konwersacyjnych
  • Poprawa doświadczeń użytkownika

Obraz przedstawiający chatbota konwersacyjnego.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Co dalej?

W tym kursie:

  • Zrozumienie podstaw i zasad RL
  • Identyfikacja, formułowanie i rozwiązywanie problemów RL
  • Zastosowanie z Gymnasium

Logo Gymnasium.

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Czas na ćwiczenia!

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Preparing Video For Download...