TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Книжный куб

15 Aug, 20:20

Открыть в Telegram Поделиться Пожаловаться

Harness: почему один агент с файлами вытесняет сложные обвязки (Рубрика #AI4SDLC)

Посмотрел доклад Константина Крестникова (CTO GigaChain, Сбер) «Harness: новый подход к созданию AI-агентов» с Data Fest 2026. Это компактная история о том, как индустрия за четыре года прошла путь от чат-бота до универсального агента, и почему сложные мультиагентные обвязки начали проигрывать «одному агенту с файлами».

Эволюция по докладу выглядит так:

- Конец 2022: чистые LLM и ранний ChatGPT — текст на входе, текст на выходе, без памяти и инструментов;
- 2023: ReAct-агенты — модель в цикле сама решает, вызвать инструмент или ответить, и рефлексирует результаты вызовов;
- Рубеж 2023–2024: агентов заворачивают в цепочки с пре- и постобработкой и structured output — время LangChain и LlamaIndex;
- Дальше (2024-2025) цепочки ветвятся в графы и мультиагентные системы: агент-планировщик, агент-критик, LangGraph, AutoGPT, CrewAI. Всё это scaffolding — «строительные леса» вокруг модели;
- Сейчас (с 2025): harness — один универсальный агент уровня Claude Code или Codex, работающий в пространстве файлов. Метафора в названии точная: LLM — тяговая сила, файлы — поле, harness — упряжка.

Ключевой сдвиг: мощным моделям сложная обвязка перестала быть нужна — достаточно положить агенту правильные файлы и инструкцию в AGENTS.md. Внутри любого харнеса всё тот же ReAct-цикл, а базовых инструментов четыре: чтение файла, поиск по файлам, редактирование и bash (всего из коробки 25–30). При этом, по наблюдению команды, при одной и той же модели харнес даёт разброс в 20–30 п.п. качества.

Практическая часть — как команда GigaChain выбирала харнес для GigaChat:

- Взяли open-source DeepAgents от LangChain: GigaChat подключился правкой конфига благодаря адаптеру langchain-gigachat;
- Замерились на соревновании из канала «LLM под капотом»: Claude Code с Sonnet решает 70 задач из 104, DeepAgents с той же моделью — 67. Просадка небольшая, при том что Anthropic оптимизирует харнес и модель друг под друга;
- Использовали киллер-фичу DeepAgents — профили моделей: вендор выпускает Python-пакет, учитывающий сильные и слабые стороны своей модели. Такой профиль сделали для GigaChat;
- Собрали свой бенчмарк harness-bench-fast: задачи на файлы, память, grep и разбор CSV с golden-ответами без LLM-judge, прогон около 20 минут на любом харнесе; выложен в open source;
- Запустили автоулучшение по циклу «гипотеза → замер → оставить или откатить» (около 15 гипотез, часть предложил Claude): по словам докладчика, это дало +22,5 п.п. на своём бенчмарке чистым промптингом, а на внешнем соревновании — рост качества на 41%.

Самая любопытная часть — про то, что дальше. Контекст любого харнеса заканчивается, а суммаризация резко «оглупляет» агента. Ответ — Ralph loop Джеффри Хантли: харнес запускают в бесконечном bash-цикле, состояние живёт в файлах, и каждый перезапуск возвращает модель в «умную зону» первых 30–40% контекста. Против вырождения (Карпаты показывает его на анекдотах: попросите у модели двадцать анекдотов — панчлайна будет три) Крестников добавил MetaLoop — внешний цикл, который стартует Ralph loop с чистого листа новым «поколением»; оно позже находит наработки предыдущего, но идёт своим путём.

Из этого вырос Anima SDK: в первом эксперименте агент с задачей «стань разумным существом» проработал 13 поколений за пять дней, однажды попробовал замолчать — вывел несколько точек и записал, что молчать агент не может. Практичнее применять то же самое к исследованиям, переводам больших книг и автоулучшению агентов — задачам, где оптимальный путь заранее неизвестен.

Итого, из этого короткого доклада видно, что центр тяжести инженерии агентов сместился из кода обвязки в среду — файлы, инструкции, тесты и бенчмарки, удерживающие агента (Хантли называет это backpressure). А выбор харнеса стал отдельным инженерным решением, которое стоит замерять на своих задачах, а не принимать по умолчанию.

#AI #AI4SDLC #Agents #Evals #DevTools #Engineering
Константин Крестников | Harness: новый подход к созданию AI-агентов
Спикер: Константин Крестников, управляющий директор, Сбер Data Fest 2026: https://ods.ai/events/datafest2026 Презентацию к докладу Вы можете скачать в треке секции GenAI от Сбера https://ods.ai/tracks/df26_sber_genai ______ Наши соц.сети: Telegram: https://t.me/datafest Вконтакте: https://vk.com/...

2.8k 0 106 63 19
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot