Стартапы на RL-средах теперь под угрозой?
Вышел открытый движок CUA-Gym, который автоматически генерирует всё необходимое для обучения computer-use агентов: задачи, среды, функции награды. Без ручной разметки.
32 000+ верифицированных кортежей, 110 сред, open-source модель, которая набирает 72.6% на OSWorld против 72.9% у Claude Sonnet 4.6.
Сопоставимые результаты при кратно меньшем размере модели. При большем числе шагов RL разрыв, вероятно, исчезнет.
Пока индустрия работает с протоколами x402, A2A, MCP, тихо формируется другой слой агентной инфраструктуры - фабрики данных. Не датасеты, а движки, которые производят обучающие данные в промышленных масштабах.
Узкое место в обучении агентов сегодня не алгоритмы, а данные.
Paper.
Набор данных.
GitHub.
Environments.
Больше об инфраструктуре ИИ-агентов здесь.
Вышел открытый движок CUA-Gym, который автоматически генерирует всё необходимое для обучения computer-use агентов: задачи, среды, функции награды. Без ручной разметки.
32 000+ верифицированных кортежей, 110 сред, open-source модель, которая набирает 72.6% на OSWorld против 72.9% у Claude Sonnet 4.6.
Сопоставимые результаты при кратно меньшем размере модели. При большем числе шагов RL разрыв, вероятно, исчезнет.
Пока индустрия работает с протоколами x402, A2A, MCP, тихо формируется другой слой агентной инфраструктуры - фабрики данных. Не датасеты, а движки, которые производят обучающие данные в промышленных масштабах.
Узкое место в обучении агентов сегодня не алгоритмы, а данные.
Paper.
Набор данных.
GitHub.
Environments.
Больше об инфраструктуре ИИ-агентов здесь.