Proximal Policy Optimization
Introduction
Proximal Policy Optimization (PPO) is an algorithm that aims to improve the stability of training by avoiding overly large policy updates. It is a popular and effective method used for training [[Reinforcement Learning | reinforcement le...
dwarvesf.hashnode.dev3 min read