Гонка накаляется. Meta показала как обучать ИИ-агентов без человеческих данных
Meta FAIR представила Self-play SWE-RL (SSR) — метод обучения агентов через самоигру, без человеческих данных. Все подробности тут.
Это серьёзный шаг к агентам, которые учатся программировать без копирования человеческих решений.
Философия та же, что у AlphaZero — правила игры дают достаточно сигнала для самоулучшения.
Пока это proof of concept на 32млрд модели. Но направление задано - будущие сверхразумные ИИ-агенты для кодинга, вероятно, будут обучаться через самоигру на миллионах репозиториев.
*запрещенная организация в России.
Meta FAIR представила Self-play SWE-RL (SSR) — метод обучения агентов через самоигру, без человеческих данных. Все подробности тут.
Это серьёзный шаг к агентам, которые учатся программировать без копирования человеческих решений.
Философия та же, что у AlphaZero — правила игры дают достаточно сигнала для самоулучшения.
Пока это proof of concept на 32млрд модели. Но направление задано - будущие сверхразумные ИИ-агенты для кодинга, вероятно, будут обучаться через самоигру на миллионах репозиториев.
*запрещенная организация в России.