| Agent | Action space | Policy | Data |
|---|---|---|---|
| A2C | Discrete or continuous | Stochastic actor-critic | On-policy rollout |
| DDPG | Continuous | Deterministic | Replay buffer |
| DQN / DDQN | Discrete | Epsilon-greedy Q policy | Replay buffer |
| PPO | Discrete or continuous | Clipped stochastic policy | On-policy rollout |
| Q-learning | Discrete | Epsilon-greedy linear Q | Transition |
| REINFORCE | Discrete | Categorical policy | Complete episode |
| SAC+gSDE | Continuous | Entropy-regularized gSDE | Replay buffer |
| True Online Sarsa(λ) | Discrete | Epsilon-greedy linear Q | Transition |
All neural agents receive a Rindow Neural Networks Builder. Linear tile-coded
agents receive the active linear algebra object and may optionally receive the
builder for device-to-host observation conversion.