Fundamentele învățării prin consolidare

Reinforcement Learning cu Gymnasium în Python

Fouad Trad

Machine Learning Engineer

Învățarea prin consolidare

 

  • Agentul învață prin încercare și eroare

 

Imagine cu două pictograme: una pentru agent și una pentru mediu.

Reinforcement Learning cu Gymnasium în Python

Învățarea prin consolidare

 

  • Agentul învață prin încercare și eroare

 

Imagine care arată că observațiile sunt transmise de la mediu către agent.

Reinforcement Learning cu Gymnasium în Python

Învățarea prin consolidare

 

  • Agentul învață prin încercare și eroare

 

Imagine care arată că mediul furnizează agentului observații, iar agentul efectuează acțiuni în consecință.

Reinforcement Learning cu Gymnasium în Python

Învățarea prin consolidare

 

  • Agentul învață prin încercare și eroare
  • Agentul primește:
    • Recompense pentru decizii bune
    • Penalizări pentru decizii greșite
  • Scop: maximizarea feedback-ului pozitiv în timp

 

Imagine care arată că mediul furnizează agentului observații, agentul efectuează acțiuni și primește recompense sau penalizări în funcție de acestea.

Reinforcement Learning cu Gymnasium în Python

RL ca dresaj al unui animal de companie

Imagine cu un bătrân (mediul) care dresează un animal de companie (agentul).

Reinforcement Learning cu Gymnasium în Python

RL vs. alte tipuri de ML

Imaginea prezintă un tabel cu titlul „Învățare supravegheată", indicând că tipul de date utilizat este date etichetate, obiectivul principal este predicția rezultatelor pe baza datelor de intrare și este potrivit pentru sarcini de clasificare și regresie.

Reinforcement Learning cu Gymnasium în Python

RL vs. alte tipuri de ML

Imaginea prezintă un tabel comparativ între Învățarea supravegheată și Învățarea nesupravegheată. Învățarea supravegheată: date etichetate, predicția rezultatelor, potrivită pentru clasificare și regresie. Învățarea nesupravegheată: date neetichetate, descoperirea tiparelor sau asocierilor, potrivită pentru clustering și analiza asocierilor.

Reinforcement Learning cu Gymnasium în Python

RL vs. alte tipuri de ML

Imaginea prezintă un tabel extins care include RL alături de Învățarea supravegheată și nesupravegheată. Învățarea supravegheată folosește date etichetate pentru predicție, potrivită pentru clasificare și regresie. Învățarea nesupravegheată folosește date neetichetate pentru descoperirea tiparelor, potrivită pentru clustering și analiza asocierilor. RL nu necesită date de antrenament predefinite și se concentrează pe luarea deciziilor care maximizează recompensele din mediu, potrivită pentru sarcini de decizie.

Reinforcement Learning cu Gymnasium în Python

Când se utilizează RL?

 

  • Luarea deciziilor secvențiale
    • Deciziile influențează observațiile viitoare
  • Învățare prin recompense și penalizări
    • Fără supraveghere directă

Pictogramă pentru un robot

Reinforcement Learning cu Gymnasium în Python

Potrivit pentru RL: jocuri video

  • Jucătorul ia decizii secvențiale
  • Primește puncte și pierde vieți în funcție de acțiuni

Imagine dintr-un joc video în care agentul ia o decizie.

Reinforcement Learning cu Gymnasium în Python

Nepotrivit pentru RL: recunoașterea obiectelor în joc

  • Fără decizii secvențiale
  • Fără interacțiune cu un mediu

Imagine dintr-un joc video în care scopul este recunoașterea diferitelor tipuri de pokemoni.

Reinforcement Learning cu Gymnasium în Python

Aplicații ale RL

Robotică
  • Mersul robotului
  • Manipularea obiectelor

Imagine cu o mână de robot.

Reinforcement Learning cu Gymnasium în Python

Aplicații ale RL

Robotică
  • Mersul robotului
  • Manipularea obiectelor

Imagine cu o mână de robot.

Finanțe
  • Optimizarea tranzacționării și investițiilor
  • Maximizarea profitului

Imagine cu o sumă mare de bani ieșind dintr-o servietă deschisă pe fundal albastru, sugerând succesul financiar.

Reinforcement Learning cu Gymnasium în Python

Aplicații ale RL

Vehicule autonome
  • Îmbunătățirea siguranței și eficienței
  • Reducerea riscului de accidente

Imagine cu mai multe vehicule autonome circulând pe șosea.

Reinforcement Learning cu Gymnasium în Python

Aplicații ale RL

Vehicule autonome
  • Îmbunătățirea siguranței și eficienței
  • Reducerea riscului de accidente

Imagine cu mai multe vehicule autonome circulând pe șosea.

Dezvoltarea chatboților
  • Îmbunătățirea abilităților conversaționale
  • Optimizarea experienței utilizatorilor

Imagine cu un chatbot conversațional.

Reinforcement Learning cu Gymnasium în Python

Ce urmează?

În acest curs vom:

  • Înțelege fundamentele și principiile RL
  • Identifica, formula și rezolva probleme de RL
  • Aplica cu Gymnasium

Sigla Gymnasium.

Reinforcement Learning cu Gymnasium în Python

Să exersăm!

Reinforcement Learning cu Gymnasium în Python

Preparing Video For Download...