Кто круче управляет компанией — ИИ или скрипт на 200 строк?
Мы всё спорим, какая модель умнее: кто лучше пишет код, кто быстрее считает, у кого длиннее контекст. Но управление компанией — это не одна задача. Это тысяча связанных решений на длинной дистанции, где последствия приходят с задержкой, а данные вокруг далеко не всегда точны. И вот с этим у ИИ всё сложно.
Наткнулся на свежий бенчмарк CEO-Bench, который проверяет способность моделей вести компанию к цели. Авторы из Princeton University называют это steering intelligence.
Условия: агент управляет SaaS-стартапом 500 дней через программный интерфейс — 34 инструмента, база из 19 таблиц, живой рынок. На старте $1 млн и ноль клиентов. Метрика одна — сколько денег на счёте в конце.
Актуальный результат (лидерборд обновляется, я смотрю на сегодняшний):
Rule-Based Baseline — $15,76 млн
Claude Fable 5 — $12,63 млн
GPT-5.6 Sol — $11,31 млн
Claude Opus 4.8 — $2,40 млн
Выше стартового миллиона удержались только три модели. Но самое интересное — их обошёл baseline. Простой алгоритм, который фиксирует цены и тарифы, концентрирует привлечение на узкой группе клиентов и подстраивает мощности под реальное потребление. Никакого интеллекта в цикле принятия решений.
По разбору авторов, успех коррелирует с тремя вещами: умением вычитывать скрытую структуру из данных, просчитывать последствия и подстраиваться под давление конкурентов. А сыпется большинство моделей на другом. Они не могут удержать вместе рост, качество и денежный поток на длинной дистанции.
А я как раз недавно писал пост о harness engineering. Сильная модель без внешнего контура (правил, границ, критериев решения) на коротком горизонте выглядит блестяще, а на дистанции в 500 дней проигрывает скрипту.
👉 Вывод для тех, кто уже сажает ИИ на управленческие задачи: вкладываться стоит не в модель поумнее, а в контур вокруг неё. Правила, память, сверка с данными, понятные критерии выбора.
Для калибровки: теоретический потолок в этой симуляции авторы оценивают в $2,2 млрд. То есть лучший результат — меньше процента от возможного. Бенчмарк далёк от насыщения, и это, пожалуй, главная новость: управлять вдолгую пока из моделей не умеет почти никто.
Кому интересно, репозиторий CEO-Bench и статья.
Мы всё спорим, какая модель умнее: кто лучше пишет код, кто быстрее считает, у кого длиннее контекст. Но управление компанией — это не одна задача. Это тысяча связанных решений на длинной дистанции, где последствия приходят с задержкой, а данные вокруг далеко не всегда точны. И вот с этим у ИИ всё сложно.
Наткнулся на свежий бенчмарк CEO-Bench, который проверяет способность моделей вести компанию к цели. Авторы из Princeton University называют это steering intelligence.
Условия: агент управляет SaaS-стартапом 500 дней через программный интерфейс — 34 инструмента, база из 19 таблиц, живой рынок. На старте $1 млн и ноль клиентов. Метрика одна — сколько денег на счёте в конце.
Актуальный результат (лидерборд обновляется, я смотрю на сегодняшний):
Rule-Based Baseline — $15,76 млн
Claude Fable 5 — $12,63 млн
GPT-5.6 Sol — $11,31 млн
Claude Opus 4.8 — $2,40 млн
Выше стартового миллиона удержались только три модели. Но самое интересное — их обошёл baseline. Простой алгоритм, который фиксирует цены и тарифы, концентрирует привлечение на узкой группе клиентов и подстраивает мощности под реальное потребление. Никакого интеллекта в цикле принятия решений.
По разбору авторов, успех коррелирует с тремя вещами: умением вычитывать скрытую структуру из данных, просчитывать последствия и подстраиваться под давление конкурентов. А сыпется большинство моделей на другом. Они не могут удержать вместе рост, качество и денежный поток на длинной дистанции.
Дисциплинированная стратегия в жёстких рамках обыгрывает свободную импровизацию умной модели.
А я как раз недавно писал пост о harness engineering. Сильная модель без внешнего контура (правил, границ, критериев решения) на коротком горизонте выглядит блестяще, а на дистанции в 500 дней проигрывает скрипту.
👉 Вывод для тех, кто уже сажает ИИ на управленческие задачи: вкладываться стоит не в модель поумнее, а в контур вокруг неё. Правила, память, сверка с данными, понятные критерии выбора.
Для калибровки: теоретический потолок в этой симуляции авторы оценивают в $2,2 млрд. То есть лучший результат — меньше процента от возможного. Бенчмарк далёк от насыщения, и это, пожалуй, главная новость: управлять вдолгую пока из моделей не умеет почти никто.
Кому интересно, репозиторий CEO-Bench и статья.