⚡️ Теперь RL можно обучать прямо через реальный агентный harness, даже если он для тебя black box
ClawGym II показывает интересный подход: Claude Code или OpenClaw можно оставить без изменений и всё равно встроить их в RL training loop.
Фреймворк запускает агентный harness внутри sandbox, перехватывает model calls на serving-уровне и восстанавливает из них полные trajectories. После этого PPO или GRPO могут оптимизировать поведение модели уже с учётом реальной агентной среды.
Главный плюс: training stack не нужно заново реализовывать tool routing, retries, context management или subagents.
На Qwen3-30A3B это дало:
— +9.98 п.п. Pass@1 через OpenClaw
— +14.81 п.п. через Claude Code
Причём mix-harness training тоже сработал: одна политика, обученная сразу на OpenClaw и Claude Code, не хуже одиночных вариантов под обоими harness.
То есть следующий шаг в RL для агентов — обучать модель не в упрощённой симуляции, а прямо через тот сложный стек, в котором она потом будет реально работать.
Paper: arxiv.org/abs/2608.16798
ClawGym II: Exploring Black-Box RL on Agent Harness
ClawGym II показывает интересный подход: Claude Code или OpenClaw можно оставить без изменений и всё равно встроить их в RL training loop.
Фреймворк запускает агентный harness внутри sandbox, перехватывает model calls на serving-уровне и восстанавливает из них полные trajectories. После этого PPO или GRPO могут оптимизировать поведение модели уже с учётом реальной агентной среды.
Главный плюс: training stack не нужно заново реализовывать tool routing, retries, context management или subagents.
На Qwen3-30A3B это дало:
— +9.98 п.п. Pass@1 через OpenClaw
— +14.81 п.п. через Claude Code
Причём mix-harness training тоже сработал: одна политика, обученная сразу на OpenClaw и Claude Code, не хуже одиночных вариантов под обоими harness.
То есть следующий шаг в RL для агентов — обучать модель не в упрощённой симуляции, а прямо через тот сложный стек, в котором она потом будет реально работать.
Paper: arxiv.org/abs/2608.16798
ClawGym II: Exploring Black-Box RL on Agent Harness