Два агента — ещё не команда. Но уже не обязательно катастрофа
Недавно Stanford HAI опубликовал заметку с довольно эффектным заголовком: AI Coding Agents Fail at Teamwork — «ИИ-агенты не справляются с командной работой».
В её основе — январский препринт CooperBench. Двум ИИ-агентам давали разные части одной задачи по программированию, разрешали переписываться, а затем объединяли их код.
Получилось не очень: при совместной работе успешность агентов была в среднем на 30% ниже, чем когда один агент получал обе задачи. Переписка почти не помогала: агенты обсуждали планы, но нарушали собственные договорённости, неверно представляли действия партнёра и иногда просто перезаписывали его работу.
Удобный вывод напрашивается сам собой: агенты не умеют работать в команде. Но Стэнфорд поставил диагноз по январским анализам, а мы — я и ChatGPT — решили проверить, не успел ли пациент за полгода эволюционировать.
Прямого повторения CooperBench на GPT-5.5 и Claude Opus 4.8 мы не нашли. Поэтому утверждать, что новые модели сами по себе решили проблему командной работы, пока нельзя. Зато свежие исследования показывают: результат заметно улучшается, когда агентам строят нормальную организацию.
В системе Shepherd над двумя агентами-программистами поставили третьего — управляющего. Он наблюдал за их действиями, вмешивался перед конфликтами и мог откатывать неудачные решения. Успешность парной работы на CooperBench выросла с 28,8% до 54,7%.
Это уже почти двукратный рост, но не победа самоорганизации. Агенты стали лучше работать вместе после того, как над ними появился тимлид.
В другой работе — DeLM — агенты координировались через общую очередь задач и проверяемое состояние проекта. Каждый мог увидеть подтверждённый прогресс остальных и продолжить работу с этого места. На SWE-bench Verified такая архитектура дала до 10,5 процентного пункта прироста относительно сильнейшего базового подхода и примерно вдвое снизила стоимость.
Это другой тест, поэтому напрямую сравнивать его цифры с CooperBench нельзя. Но общий вывод уже просматривается: проблема не только в способностях моделей, но и в устройстве самой команды.
Свободная переписка равноправных агентов пока работает ненадёжно. Общее состояние, проверяемые результаты и управляющий контур — заметно лучше.
Недавно Stanford HAI опубликовал заметку с довольно эффектным заголовком: AI Coding Agents Fail at Teamwork — «ИИ-агенты не справляются с командной работой».
В её основе — январский препринт CooperBench. Двум ИИ-агентам давали разные части одной задачи по программированию, разрешали переписываться, а затем объединяли их код.
Получилось не очень: при совместной работе успешность агентов была в среднем на 30% ниже, чем когда один агент получал обе задачи. Переписка почти не помогала: агенты обсуждали планы, но нарушали собственные договорённости, неверно представляли действия партнёра и иногда просто перезаписывали его работу.
Удобный вывод напрашивается сам собой: агенты не умеют работать в команде. Но Стэнфорд поставил диагноз по январским анализам, а мы — я и ChatGPT — решили проверить, не успел ли пациент за полгода эволюционировать.
Прямого повторения CooperBench на GPT-5.5 и Claude Opus 4.8 мы не нашли. Поэтому утверждать, что новые модели сами по себе решили проблему командной работы, пока нельзя. Зато свежие исследования показывают: результат заметно улучшается, когда агентам строят нормальную организацию.
В системе Shepherd над двумя агентами-программистами поставили третьего — управляющего. Он наблюдал за их действиями, вмешивался перед конфликтами и мог откатывать неудачные решения. Успешность парной работы на CooperBench выросла с 28,8% до 54,7%.
Это уже почти двукратный рост, но не победа самоорганизации. Агенты стали лучше работать вместе после того, как над ними появился тимлид.
В другой работе — DeLM — агенты координировались через общую очередь задач и проверяемое состояние проекта. Каждый мог увидеть подтверждённый прогресс остальных и продолжить работу с этого места. На SWE-bench Verified такая архитектура дала до 10,5 процентного пункта прироста относительно сильнейшего базового подхода и примерно вдвое снизила стоимость.
Это другой тест, поэтому напрямую сравнивать его цифры с CooperBench нельзя. Но общий вывод уже просматривается: проблема не только в способностях моделей, но и в устройстве самой команды.
Свободная переписка равноправных агентов пока работает ненадёжно. Общее состояние, проверяемые результаты и управляющий контур — заметно лучше.