Fundamentele învățării prin consolidare
Reinforcement Learning cu Gymnasium în Python
Fouad Trad
Machine Learning Engineer
Învățarea prin consolidare
Agentul învață prin încercare și eroare
Învățarea prin consolidare
Agentul învață prin încercare și eroare
Învățarea prin consolidare
Agentul învață prin încercare și eroare
Învățarea prin consolidare
Agentul învață prin încercare și eroare
Agentul primește:
Recompense pentru decizii bune
Penalizări pentru decizii greșite
Scop
: maximizarea feedback-ului pozitiv în timp
RL ca dresaj al unui animal de companie
RL vs. alte tipuri de ML
RL vs. alte tipuri de ML
RL vs. alte tipuri de ML
Când se utilizează RL?
Luarea deciziilor secvențiale
Deciziile influențează observațiile viitoare
Învățare prin recompense și penalizări
Fără supraveghere directă
Potrivit pentru RL: jocuri video
Jucătorul ia decizii secvențiale
Primește puncte și pierde vieți în funcție de acțiuni
Nepotrivit pentru RL: recunoașterea obiectelor în joc
Fără decizii secvențiale
Fără interacțiune cu un mediu
Aplicații ale RL
Robotică
Mersul robotului
Manipularea obiectelor
Aplicații ale RL
Robotică
Mersul robotului
Manipularea obiectelor
Finanțe
Optimizarea tranzacționării și investițiilor
Maximizarea profitului
Aplicații ale RL
Vehicule autonome
Îmbunătățirea siguranței și eficienței
Reducerea riscului de accidente
Aplicații ale RL
Vehicule autonome
Îmbunătățirea siguranței și eficienței
Reducerea riscului de accidente
Dezvoltarea chatboților
Îmbunătățirea abilităților conversaționale
Optimizarea experienței utilizatorilor
Ce urmează?
În acest curs vom:
Înțelege fundamentele și principiile RL
Identifica, formula și rezolva probleme de RL
Aplica cu Gymnasium
Să exersăm!
Reinforcement Learning cu Gymnasium în Python
Preparing Video For Download...