TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Бороздин Дмитрий

21 Jul, 15:47

Telegram'da ochish Ulashish Shikoyat qilish

Кто круче управляет компанией — ИИ или скрипт на 200 строк?

Мы всё спорим, какая модель умнее: кто лучше пишет код, кто быстрее считает, у кого длиннее контекст. Но управление компанией — это не одна задача. Это тысяча связанных решений на длинной дистанции, где последствия приходят с задержкой, а данные вокруг далеко не всегда точны. И вот с этим у ИИ всё сложно.

Наткнулся на свежий бенчмарк CEO-Bench, который проверяет способность моделей вести компанию к цели. Авторы из Princeton University называют это steering intelligence.

Условия: агент управляет SaaS-стартапом 500 дней через программный интерфейс — 34 инструмента, база из 19 таблиц, живой рынок. На старте $1 млн и ноль клиентов. Метрика одна — сколько денег на счёте в конце.

Актуальный результат (лидерборд обновляется, я смотрю на сегодняшний):

Rule-Based Baseline — $15,76 млн
Claude Fable 5
— $12,63 млн
GPT-5.6 Sol
— $11,31 млн
Claude Opus 4.8 — $2,40 млн

Выше стартового миллиона удержались только три модели. Но самое интересное — их обошёл baseline. Простой алгоритм, который фиксирует цены и тарифы, концентрирует привлечение на узкой группе клиентов и подстраивает мощности под реальное потребление. Никакого интеллекта в цикле принятия решений.

По разбору авторов, успех коррелирует с тремя вещами: умением вычитывать скрытую структуру из данных, просчитывать последствия и подстраиваться под давление конкурентов. А сыпется большинство моделей на другом. Они не могут удержать вместе рост, качество и денежный поток на длинной дистанции.

Дисциплинированная стратегия в жёстких рамках обыгрывает свободную импровизацию умной модели.


А я как раз недавно писал пост о harness engineering. Сильная модель без внешнего контура (правил, границ, критериев решения) на коротком горизонте выглядит блестяще, а на дистанции в 500 дней проигрывает скрипту.

👉 Вывод для тех, кто уже сажает ИИ на управленческие задачи: вкладываться стоит не в модель поумнее, а в контур вокруг неё. Правила, память, сверка с данными, понятные критерии выбора.

Для калибровки: теоретический потолок в этой симуляции авторы оценивают в $2,2 млрд. То есть лучший результат — меньше процента от возможного. Бенчмарк далёк от насыщения, и это, пожалуй, главная новость: управлять вдолгую пока из моделей не умеет почти никто.

Кому интересно, репозиторий CEO-Bench и статья.

918 6 28 2 22
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot