TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Бороздин Дмитрий

21 Jul, 15:47

Открыть в Telegram Поделиться Пожаловаться

Кто круче управляет компанией — ИИ или скрипт на 200 строк?

Мы всё спорим, какая модель умнее: кто лучше пишет код, кто быстрее считает, у кого длиннее контекст. Но управление компанией — это не одна задача. Это тысяча связанных решений на длинной дистанции, где последствия приходят с задержкой, а данные вокруг далеко не всегда точны. И вот с этим у ИИ всё сложно.

Наткнулся на свежий бенчмарк CEO-Bench, который проверяет способность моделей вести компанию к цели. Авторы из Princeton University называют это steering intelligence.

Условия: агент управляет SaaS-стартапом 500 дней через программный интерфейс — 34 инструмента, база из 19 таблиц, живой рынок. На старте $1 млн и ноль клиентов. Метрика одна — сколько денег на счёте в конце.

Актуальный результат (лидерборд обновляется, я смотрю на сегодняшний):

Rule-Based Baseline — $15,76 млн
Claude Fable 5
— $12,63 млн
GPT-5.6 Sol
— $11,31 млн
Claude Opus 4.8 — $2,40 млн

Выше стартового миллиона удержались только три модели. Но самое интересное — их обошёл baseline. Простой алгоритм, который фиксирует цены и тарифы, концентрирует привлечение на узкой группе клиентов и подстраивает мощности под реальное потребление. Никакого интеллекта в цикле принятия решений.

По разбору авторов, успех коррелирует с тремя вещами: умением вычитывать скрытую структуру из данных, просчитывать последствия и подстраиваться под давление конкурентов. А сыпется большинство моделей на другом. Они не могут удержать вместе рост, качество и денежный поток на длинной дистанции.

Дисциплинированная стратегия в жёстких рамках обыгрывает свободную импровизацию умной модели.


А я как раз недавно писал пост о harness engineering. Сильная модель без внешнего контура (правил, границ, критериев решения) на коротком горизонте выглядит блестяще, а на дистанции в 500 дней проигрывает скрипту.

👉 Вывод для тех, кто уже сажает ИИ на управленческие задачи: вкладываться стоит не в модель поумнее, а в контур вокруг неё. Правила, память, сверка с данными, понятные критерии выбора.

Для калибровки: теоретический потолок в этой симуляции авторы оценивают в $2,2 млрд. То есть лучший результат — меньше процента от возможного. Бенчмарк далёк от насыщения, и это, пожалуй, главная новость: управлять вдолгую пока из моделей не умеет почти никто.

Кому интересно, репозиторий CEO-Bench и статья.

918 6 28 2 22
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot