Python में Deep Reinforcement Learning
Timothée Carayol
Principal Machine Learning Engineer, Komment
| उदाहरण |
|---|
| डिस्काउंट रेट |
| PPO: क्लिपिंग एप्सिलॉन, एंट्रॉपी बोनस |
| एक्सपीरियंस रिप्ले: बफर साइज, बैच साइज |
| डिकेइड एप्सिलॉन ग्रीडिनेस शेड्यूल |
| फिक्स्ड Q-टार्गेट्स: $\tau$ |
| लर्निंग रेट |
| लेयर्स की संख्या, प्रति लेयर नोड्स... |
उद्देश्य: औसत संचयी रिवार्ड्स
हाइपरपैरामीटर सर्च तकनीकें:


Optuna वर्कफ़्लो:
study बनाएँ
import optunadef objective(trial): ...study = optuna.create_study()study.optimize(objective, n_trials=100)
study.best_params
{'learning_rate': 0.001292481, 'batch_size': 8}
ऑब्जेक्टिव फंक्शन में:
हाइपरपैरामीटर स्पेसिफिकेशन में पूरी लचीलापन:
def objective(trial: optuna.trial.Trial):# Hyperparameters x and y between -10 and 10x = trial.suggest_float('x', -10, 10) y = trial.suggest_float('y', -10, 10)# Return the metric to minimize return (x - 2) ** 2 + 1.2 * (y + 3) ** 2
n_trials सैंपल करेंn_trials छोड़ा: इंटरप्ट होने तक ट्रायल्स चलेंगी
import sqlite study = optuna.create_study( storage="sqlite:///DRL.db", study_name="my_study")study.optimize(objective, n_trials=100)
loaded_study = optuna.load_study(
study_name="my_study",
storage="sqlite:///DRL.db")
optuna.visualization.plot_param_importances(study)

optuna.visualization.plot_contour(study)

Python में Deep Reinforcement Learning