TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Пикейный аналитик

6 Jul, 23:16

Открыть в Telegram Поделиться Пожаловаться

Два агента — ещё не команда. Но уже не обязательно катастрофа

Недавно Stanford HAI опубликовал заметку с довольно эффектным заголовком: AI Coding Agents Fail at Teamwork — «ИИ-агенты не справляются с командной работой».

В её основе — январский препринт CooperBench. Двум ИИ-агентам давали разные части одной задачи по программированию, разрешали переписываться, а затем объединяли их код.

Получилось не очень: при совместной работе успешность агентов была в среднем на 30% ниже, чем когда один агент получал обе задачи. Переписка почти не помогала: агенты обсуждали планы, но нарушали собственные договорённости, неверно представляли действия партнёра и иногда просто перезаписывали его работу.

Удобный вывод напрашивается сам собой: агенты не умеют работать в команде. Но Стэнфорд поставил диагноз по январским анализам, а мы — я и ChatGPT — решили проверить, не успел ли пациент за полгода эволюционировать.

Прямого повторения CooperBench на GPT-5.5 и Claude Opus 4.8 мы не нашли. Поэтому утверждать, что новые модели сами по себе решили проблему командной работы, пока нельзя. Зато свежие исследования показывают: результат заметно улучшается, когда агентам строят нормальную организацию.

В системе Shepherd над двумя агентами-программистами поставили третьего — управляющего. Он наблюдал за их действиями, вмешивался перед конфликтами и мог откатывать неудачные решения. Успешность парной работы на CooperBench выросла с 28,8% до 54,7%.

Это уже почти двукратный рост, но не победа самоорганизации. Агенты стали лучше работать вместе после того, как над ними появился тимлид.

В другой работе — DeLM — агенты координировались через общую очередь задач и проверяемое состояние проекта. Каждый мог увидеть подтверждённый прогресс остальных и продолжить работу с этого места. На SWE-bench Verified такая архитектура дала до 10,5 процентного пункта прироста относительно сильнейшего базового подхода и примерно вдвое снизила стоимость.

Это другой тест, поэтому напрямую сравнивать его цифры с CooperBench нельзя. Но общий вывод уже просматривается: проблема не только в способностях моделей, но и в устройстве самой команды.

Свободная переписка равноправных агентов пока работает ненадёжно. Общее состояние, проверяемые результаты и управляющий контур — заметно лучше.
CooperBench: Why Coding Agents Cannot be Your Teammates Yet
Resolving team conflicts requires not only task-specific competence, but also social intelligence to find common ground and build consensus. As AI agents increasingly collaborate on complex work,...

814 0 6 5 12
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot