๐ตPPO
Proximal Policy Optimization
Algorithm: PPO
Basic Parameters
"agent": {
"name": str,
"algorithm": {
"name": "PPO",
"action_pdtype": str,
"action_policy": str,
"gamma": float,
"lam": float,
"clip_eps_spec": dict,
"entropy_coef_spec": dict,
"time_horizon": int,
"minibatch_size": int,
"training_epoch": int,
},
"memory": {
"name": "OnPolicyBatchReplay",
},
"net": {
"type": str,
"arc": dict,
"optim_spec": dict,
}
}PPO vs A2C
Lambda Tuning for Atari
Lambda
Best for
Examples
Last updated
Was this helpful?