Podstawy uczenia ze wzmocnieniem
Uczenie przez wzmacnianie z Gymnasium w Pythonie
Fouad Trad
Machine Learning Engineer
Uczenie ze wzmocnieniem
Agent uczy się metodą prób i błędów
Uczenie ze wzmocnieniem
Agent uczy się metodą prób i błędów
Uczenie ze wzmocnieniem
Agent uczy się metodą prób i błędów
Uczenie ze wzmocnieniem
Agent uczy się metodą prób i błędów
Agent otrzymuje:
Nagrody za dobre decyzje
Kary za złe decyzje
Cel
: maksymalizacja pozytywnych sygnałów w czasie
RL jako tresowanie zwierzęcia
RL a inne typy ML
RL a inne typy ML
RL a inne typy ML
Kiedy stosować RL?
Sekwencyjne podejmowanie decyzji
Decyzje wpływają na przyszłe obserwacje
Uczenie przez nagrody i kary
Brak bezpośredniego nadzoru
Odpowiednie dla RL: gry wideo
Gracz podejmuje sekwencyjne decyzje
Zdobywa punkty i traci życia w zależności od działań
Nieodpowiednie dla RL: rozpoznawanie obiektów w grze
Brak sekwencyjnego podejmowania decyzji
Brak interakcji ze środowiskiem
Zastosowania RL
Robotyka
Chodzenie robota
Manipulacja obiektami
Zastosowania RL
Robotyka
Chodzenie robota
Manipulacja obiektami
Finanse
Optymalizacja handlu i inwestycji
Maksymalizacja zysku
Zastosowania RL
Pojazdy autonomiczne
Poprawa bezpieczeństwa i efektywności
Minimalizacja ryzyka wypadków
Zastosowania RL
Pojazdy autonomiczne
Poprawa bezpieczeństwa i efektywności
Minimalizacja ryzyka wypadków
Tworzenie chatbotów
Doskonalenie umiejętności konwersacyjnych
Poprawa doświadczeń użytkownika
Co dalej?
W tym kursie:
Zrozumienie podstaw i zasad RL
Identyfikacja, formułowanie i rozwiązywanie problemów RL
Zastosowanie z Gymnasium
Czas na ćwiczenia!
Uczenie przez wzmacnianie z Gymnasium w Pythonie
Preparing Video For Download...