Harness важнее модели?В последнее время в разговорах про AI-агентов всё чаще всплывает слово
harness. Если по-простому — это вся «обвязка» вокруг модели: как строится план, как задача разбивается на шаги, как агент тестирует сам себя, как переходит между сессиями, когда решает остановиться. Модель определяет потолок того, что в принципе возможно за один заход. А harness определяет, дойдёт ли агент до финиша на длинной задаче или сдастся на середине.
Раньше это звучало как инженерная мелочь. Сейчас — как основной рычаг. Топовые модели становятся всё менее доступными (Claude Fable 5 закрыт под экспортными ограничениями, GPT-5.6 раздают ограниченному кругу партнёров), и в этой ситуации именно harness — это то, что бизнес реально может строить и улучшать сам.
Хороший наглядный пример — свежий
релиз Zenith от Intelligent Internet. Они прогнали свой harness на бенчмарке
Frontier SWE — это 17 самых сложных long-horizon задач по разработке, где агенту даётся до 20 часов на задачу, и большинство систем всё равно не справляются.
Что получилось:
- Base-модель
GPT-5.5 на дефолтном Codex-harness —
5-е место (средний ранг 5.53).
- Та же самая GPT-5.5, но обёрнутая в Zenith —
1-е место (средний ранг 2.06), впереди даже Claude Fable, который считается сильнейшей моделью на этом бенчмарке.
- На самой длинной категории задач (implementation) разрыв ещё драматичнее: 7.40 против 1.60. То есть чем длиннее горизонт задачи, тем сильнее вклад harness.
Модель — та же. Бюджет — тот же. Изменили только контур управления вокруг модели.
Что именно они докрутили в harness — это отдельно интересно. Авторы разобрали пять существующих harness-дизайнов и выделили механики, которые реально дают эффект: постоянный поиск пробелов в решении, ревизуемое планирование, независимая верификация (агент не сам себе судья), адаптивная оркестрация и дисциплина остановки. Отдельная находка — большинство агентов
сдают задачу слишком рано не потому, что зашли в тупик, а из-за overconfidence: сами себе пишут поверхностные тесты и на них же радостно проходят. Внешняя проверка убирает именно эту дыру.
Второй слой — Meta-Zenith, который сам собирает harness под новую задачу, потому что вручную писать оркестрацию под каждый класс задач не масштабируется.
Что из этого для бизнеса:
- Когда у вас агент «почти работает, но не дотягивает» на реальной задаче — рефлекс поменять модель на более сильную часто не оптимален. Особенно с учётом того, что frontier-модели всё чаще gated.
- Инвестиции в harness (планирование, независимое тестирование, критерии остановки) дают прирост, сопоставимый с переходом на модель следующего поколения — и он остаётся с вами, когда модель обновится.
Вопрос, который меня здесь занимает: как далеко можно уехать на этой идее? Если harness сегодня закрывает разрыв между 5-м и 1-м местом, то через год-два, когда сами модели ещё подрастут, вклад правильной обвязки может оказаться ещё больше — или, наоборот, растворится в том, что модели научатся всему этому сами. Пока ставлю на первое.