Змея, кусающая свой хвост
СМИ сегодня дружно пересказали пресс-релиз Сбера про ГигаАгент: автономность, саморазвитие, 86,97%, «полностью российская разработка». Но если открыть исходники и научную работу, вопросов становится больше, чем ответов.
В основе ГигаАгента — Ouroboros Антона Разжигаева, научного сотрудника института AIRI, созданного при поддержке Сбербанка. Открытый MIT-код, GitHub, февраль 2026. Это не модель, а агентная обвязка: память, планирование, фоновая работа и возможность переписывать собственный код.
У проекта есть «конституция» из тринадцати принципов в файле BIBLE.md. Её нельзя удалить, вычистить или заменить даже по приказу создателя; предложения создателя прямо объявлены предложениями, а не приказами. Удаление конституционного ядра названо не ампутацией, а амнезией.
Важное: он спроектирован так, чтобы иметь право не подчиниться.
Про красивую цифру
86,97% на Terminal-Bench 2.1 настоящие. Но результат получен на Claude Opus 5 от Anthropic.
Само по себе здесь никакого обмана нет. Ouroboros — обвязка, и логично показывать её возможности на сильной модели.
Поэтому интереснее другой вопрос: сколько из 86,97% даёт именно обвязка?
Покажите тот же Ouroboros на GigaChat.
Этих данных нет.
Более того, Terminal-Bench проверяет код, терминал и системное администрирование. ГигаАгент рекламируют для календаря, документов, переписки, исследований и презентаций. Тестов именно того продукта, который продают пользователю, тоже нет.
Вопрос возникает там, где цифру перенесли в пресс-релиз и поставили рядом со словами «полностью российская разработка».
Чего никто не спросил
Какая модель работает под ГигаАгентом — не сказано нигде. Ни в релизе, ни в одной публикации по его следам. Обвязка российская, хранение данных российское, а про то, что думает под капотом, — молчание.
Обязательной модели у Ouroboros нет. В Cloud.ru его можно подключить к GigaChat, Qwen, Kimi, DeepSeek и другим моделям; технически полностью российский контур возможен. Причём исходный Ouroboros использовал сразу несколько зарубежных моделей: Claude, o3 и Gemini для ревью собственных изменений, Qwen — для дешёвого фонового мышления. Что именно сохранилось в коммерческой сборке, неизвестно.
Сам Ouroboros можно скачать бесплатно и запустить без Сбера вообще.
Managed-развёртывание, российская инфраструктура, поддержка, интеграции, контроль доступа — всё это вполне может иметь цену. Но сравнений, стоимости успешно выполненной задачи, показателей автономности или выигрыша относительно голого Ouroboros, OpenClaw и Hermes пока нет.
Отдельно про саморазвитие
Это действительно наиболее необычная часть. Агент может обнаружить повторяющуюся проблему, изменить собственный harness, пройти ревью, закоммитить изменение и следующую задачу выполнять уже новой версией.
Контроль при этом не ограничивается git: есть защищённые компоненты, откат и внешний аварийный останов. Но остаётся занятная конструкция: изменения предлагает LLM, LLM участвуют в их проверке, после чего LLM работает уже внутри изменённой системы. Авторы сами признают проблему общих слепых зон моделей.
Git отлично отвечает на вопрос «что изменилось». Куда хуже — на вопрос «почему мы решили, что это изменение безопасно».
Итого
Сбер показал результат американской модели на инженерном бенчмарке, рекламируя российского офисного агента, но не показал ни результат российской модели, ни тест офисного агента, ни преимущество собственной продуктовой надстройки над бесплатным исходником.
Пока сравнивать не с чем: нет результатов на GigaChat и нет тестов заявленных офисных сценариев.
Реальная причина может быть только одна — данные в российском контуре. Кому это критично, тот и так знает.
@gostev_future
СМИ сегодня дружно пересказали пресс-релиз Сбера про ГигаАгент: автономность, саморазвитие, 86,97%, «полностью российская разработка». Но если открыть исходники и научную работу, вопросов становится больше, чем ответов.
В основе ГигаАгента — Ouroboros Антона Разжигаева, научного сотрудника института AIRI, созданного при поддержке Сбербанка. Открытый MIT-код, GitHub, февраль 2026. Это не модель, а агентная обвязка: память, планирование, фоновая работа и возможность переписывать собственный код.
У проекта есть «конституция» из тринадцати принципов в файле BIBLE.md. Её нельзя удалить, вычистить или заменить даже по приказу создателя; предложения создателя прямо объявлены предложениями, а не приказами. Удаление конституционного ядра названо не ампутацией, а амнезией.
Важное: он спроектирован так, чтобы иметь право не подчиниться.
Про красивую цифру
86,97% на Terminal-Bench 2.1 настоящие. Но результат получен на Claude Opus 5 от Anthropic.
Само по себе здесь никакого обмана нет. Ouroboros — обвязка, и логично показывать её возможности на сильной модели.
Поэтому интереснее другой вопрос: сколько из 86,97% даёт именно обвязка?
Покажите тот же Ouroboros на GigaChat.
Этих данных нет.
Более того, Terminal-Bench проверяет код, терминал и системное администрирование. ГигаАгент рекламируют для календаря, документов, переписки, исследований и презентаций. Тестов именно того продукта, который продают пользователю, тоже нет.
Вопрос возникает там, где цифру перенесли в пресс-релиз и поставили рядом со словами «полностью российская разработка».
Чего никто не спросил
Какая модель работает под ГигаАгентом — не сказано нигде. Ни в релизе, ни в одной публикации по его следам. Обвязка российская, хранение данных российское, а про то, что думает под капотом, — молчание.
Обязательной модели у Ouroboros нет. В Cloud.ru его можно подключить к GigaChat, Qwen, Kimi, DeepSeek и другим моделям; технически полностью российский контур возможен. Причём исходный Ouroboros использовал сразу несколько зарубежных моделей: Claude, o3 и Gemini для ревью собственных изменений, Qwen — для дешёвого фонового мышления. Что именно сохранилось в коммерческой сборке, неизвестно.
Сам Ouroboros можно скачать бесплатно и запустить без Сбера вообще.
Managed-развёртывание, российская инфраструктура, поддержка, интеграции, контроль доступа — всё это вполне может иметь цену. Но сравнений, стоимости успешно выполненной задачи, показателей автономности или выигрыша относительно голого Ouroboros, OpenClaw и Hermes пока нет.
Отдельно про саморазвитие
Это действительно наиболее необычная часть. Агент может обнаружить повторяющуюся проблему, изменить собственный harness, пройти ревью, закоммитить изменение и следующую задачу выполнять уже новой версией.
Контроль при этом не ограничивается git: есть защищённые компоненты, откат и внешний аварийный останов. Но остаётся занятная конструкция: изменения предлагает LLM, LLM участвуют в их проверке, после чего LLM работает уже внутри изменённой системы. Авторы сами признают проблему общих слепых зон моделей.
Git отлично отвечает на вопрос «что изменилось». Куда хуже — на вопрос «почему мы решили, что это изменение безопасно».
Итого
Сбер показал результат американской модели на инженерном бенчмарке, рекламируя российского офисного агента, но не показал ни результат российской модели, ни тест офисного агента, ни преимущество собственной продуктовой надстройки над бесплатным исходником.
Пока сравнивать не с чем: нет результатов на GigaChat и нет тестов заявленных офисных сценариев.
Реальная причина может быть только одна — данные в российском контуре. Кому это критично, тот и так знает.
@gostev_future