Pythonで学ぶDeep Reinforcement Learning
Timothée Carayol
Principal Machine Learning Engineer, Komment
| 例 |
|---|
| 割引率 |
| PPO: クリッピング ε、エントロピー報酬 |
| 経験再生: バッファサイズ、バッチサイズ |
| 減衰 ε-greedy スケジュール |
| 固定 Q-ターゲット: $\tau$ |
| 学習率 |
| 層数、各層のノード数 など |
目的: 平均累積報酬
ハイパーパラメータ探索手法:


Optuna のワークフロー:
study を作成
import optunadef objective(trial): ...study = optuna.create_study()study.optimize(objective, n_trials=100)
study.best_params
{'learning_rate': 0.001292481, 'batch_size': 8}
目的関数では:
ハイパーパラメータ指定は柔軟:
def objective(trial: optuna.trial.Trial):# Hyperparameters x and y between -10 and 10x = trial.suggest_float('x', -10, 10) y = trial.suggest_float('y', -10, 10)# Return the metric to minimize return (x - 2) ** 2 + 1.2 * (y + 3) ** 2
n_trials を実行n_trials を省略すると、中断まで実行
import sqlite study = optuna.create_study( storage="sqlite:///DRL.db", study_name="my_study")study.optimize(objective, n_trials=100)
loaded_study = optuna.load_study(
study_name="my_study",
storage="sqlite:///DRL.db")
optuna.visualization.plot_param_importances(study)

optuna.visualization.plot_contour(study)

Pythonで学ぶDeep Reinforcement Learning