rindow-rl-agents

Agents

Agent Action space Policy Data
A2C Discrete or continuous Stochastic actor-critic On-policy rollout
DDPG Continuous Deterministic Replay buffer
DQN / DDQN Discrete Epsilon-greedy Q policy Replay buffer
PPO Discrete or continuous Clipped stochastic policy On-policy rollout
Q-learning Discrete Epsilon-greedy linear Q Transition
REINFORCE Discrete Categorical policy Complete episode
SAC+gSDE Continuous Entropy-regularized gSDE Replay buffer
True Online Sarsa(λ) Discrete Epsilon-greedy linear Q Transition

All neural agents receive a Rindow Neural Networks Builder. Linear tile-coded agents receive the active linear algebra object and may optionally receive the builder for device-to-host observation conversion.