Продвинутые RL алгоритмы: NPG, TRPO, PPO
#почитать
Алгоритмы REINFORCE и A2C (Advantage Actor–Critic) относятся к классу on-policy алгоритмов: политика обучается только на данных, собранных текущей версией агента. После каждого обновления старые траектории не могут быть повторно использованы. Естественное желание – обучаться более оптимально, выполняя несколько шагов оптимизации на одном и том же наборе траекторий.
Эта идея была реализована в алгоритме TRPO (Trust Region Policy Optimization). Однако, он требует сложной оптимизации второго порядка и плохо масштабируется. Но его идеи легли в основу алгоритма PPO (Proximal Policy Optimization) – более простого с точки зрения реализации и более эффективного на практике. Благодаря этому PPO стал стандартным инструментом для обучения агентов в задачах управления, игровых средах, робототехнике и в RLHF при обучении больших языковых моделей.
✅Читать статью
#почитать
Алгоритмы REINFORCE и A2C (Advantage Actor–Critic) относятся к классу on-policy алгоритмов: политика обучается только на данных, собранных текущей версией агента. После каждого обновления старые траектории не могут быть повторно использованы. Естественное желание – обучаться более оптимально, выполняя несколько шагов оптимизации на одном и том же наборе траекторий.
Эта идея была реализована в алгоритме TRPO (Trust Region Policy Optimization). Однако, он требует сложной оптимизации второго порядка и плохо масштабируется. Но его идеи легли в основу алгоритма PPO (Proximal Policy Optimization) – более простого с точки зрения реализации и более эффективного на практике. Благодаря этому PPO стал стандартным инструментом для обучения агентов в задачах управления, игровых средах, робототехнике и в RLHF при обучении больших языковых моделей.
✅Читать статью