Deep Reinforcement Learning în Python
Timothée Carayol
Principal Machine Learning Engineer, Komment
| Exemple |
|---|
| Rata de reducere |
| PPO: epsilon de tăiere, bonus de entropie |
| Experience replay: dimensiunea buffer-ului, dimensiunea batch-ului |
| Programul epsilon greedy cu scădere |
| Q-ținte fixe: $\tau$ |
| Rata de învățare |
| Număr de straturi, noduri per strat... |
Obiectiv: recompense cumulative medii
Tehnici de căutare a hiperparametrilor:


Fluxul de lucru Optuna:
study Optuna
import optunadef objective(trial): ...study = optuna.create_study()study.optimize(objective, n_trials=100)
study.best_params
{'learning_rate': 0.001292481, 'batch_size': 8}
În funcția obiectiv:
Flexibilitate completă în specificarea hiperparametrilor:
def objective(trial: optuna.trial.Trial):# Hyperparameters x and y between -10 and 10x = trial.suggest_float('x', -10, 10) y = trial.suggest_float('y', -10, 10)# Return the metric to minimize return (x - 2) ** 2 + 1.2 * (y + 3) ** 2
n_trials cu samplerul implicit (TPE)n_trials este omis: rulează până la întrerupere
import sqlite study = optuna.create_study( storage="sqlite:///DRL.db", study_name="my_study")study.optimize(objective, n_trials=100)
loaded_study = optuna.load_study(
study_name="my_study",
storage="sqlite:///DRL.db")
optuna.visualization.plot_param_importances(study)

optuna.visualization.plot_contour(study)

Deep Reinforcement Learning în Python