Algoritmul DQN complet

Deep Reinforcement Learning în Python

Timothée Carayol

Principal Machine Learning Engineer, Komment

Algoritmul DQN

 

 

  • Am studiat DQN cu Reluare de Experiență
  • Aproape de DQN-ul publicat inițial (2015)
  • Lipsesc încă două componente:
    • Epsilon-lăcomie -> explorare mai amplă
    • Q-ținte fixe -> învățare mai stabilă

O aventurieră alături de litera grecească epsilon

Litera majusculă Q, înghețată într-un bloc de gheață

Deep Reinforcement Learning în Python

Epsilon-lăcomia în algoritmul DQN

  • Implementați Epsilon-lăcomia cu Decădere în select_action()
def select_action(q_values, step, start, end, decay):

# Calculate the threshold value for this step epsilon = ( end + (start-end) * math.exp(-step / decay))
# Draw a random number between 0 and 1 sample = random.random()
if sample < epsilon: # Return a random action index return random.choice(range(len(q_values)))
# Return the action index with highest Q-value return torch.argmax(q_values).item()
  • $\varepsilon = end + (start-end) \cdot e^{-\frac{step}{decay}}$
  • Acțiune aleatorie cu probabilitatea $\varepsilon$
  • Acțiunea cu valoarea maximă cu probabilitatea $1 - \varepsilon$

Un grafic reprezentând programul de decădere Epsilon pentru diferite valori ale parametrului de decădere.

Deep Reinforcement Learning în Python

Q-ținte fixe

 

  • În Eroarea Bellman:
    • Rețeaua Q în calculul atât al Valorii Q, cât și al TD-Țintei
    • Instabilitate cauzată de ținta în schimbare

 

  • Introducerea rețelei țintă pentru stabilizarea țintei

 

Eroarea Bellman: (r_t+1 + gamma max(Q(s_t+1, a))) - Q(s_t, a_t)

(r_t+1 + gamma max(Q_target(s_t+1, a))) - Q_online(s_t, a_t)

Deep Reinforcement Learning în Python

Implementarea Q-țintelor fixe

online_network = QNetwork(state_size, action_size)
target_network = QNetwork(state_size, action_size)

target_network.load_state_dict( online_network.state_dict())
def update_target_network( target_network, online_network, tau):
target_net_state_dict = target_network.state_dict() online_net_state_dict = online_network.state_dict() for key in online_net_state_dict:
target_net_state_dict[key] = ( online_net_state_dict[key] * tau + target_net_state_dict[key] * (1 - tau))
target_network.load_state_dict( target_net_state_dict)
return None
  • Inițial, Rețeaua Online = Rețeaua Țintă
  • Dicționarul de stare al unei rețele conține toți parametrii: reprezentarea unui dicționar de stare al rețelei, cu intrări pentru fc1.weight, fc1.bias și fc2.weight; valoarea fiecărei intrări este un tensor.
  • La fiecare pas, fiecare parametru al Rețelei Țintă se apropie puțin de Rețeaua Online
Deep Reinforcement Learning în Python

Calculul erorii cu Q-ținte fixe

# In the inner loop, after action selection
if len(replay_buffer) >= batch_size:
  states, actions, rewards, next_states, dones = 
      replay_buffer.sample(64)

q_values = (online_network(states) .gather(1, actions).squeeze(1))
with torch.no_grad():
next_q_values = ( target_network(next_states).amax(1)) target_q_values = ( rewards + gamma * next_q_values * (1 - dones))
loss = torch.nn.MSELoss()(target_q_values, q_values) optimizer.zero_grad() loss.backward() optimizer.step()
update_target_network( target_network, online_network, tau)

 

  • Valorile Q utilizează online_network
  • Valorile Q țintă utilizează target_network
  • Utilizați torch.no_grad() pentru a dezactiva urmărirea gradienților pentru valorile Q țintă
  • Se utilizează în continuare Eroarea Bellman pătratică medie pentru calculul erorii
  • Utilizați update_target_network() pentru a actualiza lent target_network
Deep Reinforcement Learning în Python

Să exersăm!

Deep Reinforcement Learning în Python

Preparing Video For Download...