TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Книжный куб

21 Aug, 08:08

Открыть в Telegram Поделиться Пожаловаться

Evolution of Agentic Surfaces: harness становится инфраструктурой (Рубрика #AI4SDLC)

Посмотрел доклад команды Applied AI из Anthropic — Gagan Bhat и Isabella Kai He — про эволюцию агентных поверхностей: от Messages API до Claude Managed Agents. Тезис, который я забираю: harness кодирует предположения о том, чего модель пока не умеет, поэтому это самая скоропортящаяся часть агентного стека. Доклад удачно собирает темы последних дней канала: минус 80% промпта Claude Code от Boris Cherny, облачные агенты Cursor и harness-подход Константина Крестникова,

Сюжет — три поколения поверхностей
1️⃣ Сначала Messages API: токены на входе, токены на выходе, а агентный цикл каждый писал сам
2️⃣ Потом Claude Agent SDK, упаковавший harness Claude Code в библиотеку: цикл, инструменты и файловая система приезжают в коробке, но hosting, изоляция, credentials и наблюдаемость остаются на вас
3️⃣ Теперь Claude Managed Agents: Anthropic забирает production-обвязку целиком, а вам остаются задача, контекст и доменная экспертиза. Граница «что моё» продолжает сжиматься — тот же сдвиг, что Джош Ма описывал для Cursor, только с другой стороны прилавка.

Лучшая иллюстрация скоропортящихся предположений — context anxiety у Sonnet 4.5: модель нервничала при приближении к границе контекста и сворачивала работу раньше времени (в Cognition наблюдали то же самое), поэтому команда встроила в обвязку сбросы контекста. Opus 4.5 вышел уже без этого поведения — и костыль превратился в чистый оверхед: лишняя латентность и некорректно сбрасываемый кеш. Когда модель сдвигается, а harness нет, обвязка начинает деградировать агента. Это то же явление, что и у Boris Cherny с системным промптом, только на уровне архитектуры, а не текста.

Инженерно самое интересное — разделение «мозга» и «рук». Пока агентный цикл и sandbox жили в одном контейнере, модель не могла начать рассуждать до конца сборки среды, а падение любой половины убивало агента целиком. После разделения reasoning стартует сразу, контейнер поднимается параллельно: по замерам команды, время до первого токена сократилось на 60% в медиане и более чем на 90% в P95. Отказы становятся восстановимыми: умерший sandbox пересоздаётся, умерший «мозг» поднимается из durable session log. Сам журнал сессии работает трижды: наблюдаемость, возврат выброшенных из контекста кусков и периодический batch-процесс dreaming, который переписывает память агента, чтобы следующие сессии начинались умнее.

После инцидента OpenAI и Hugging Face отдельно отмечу security-часть: credentials живут в vault и расшифровываются только в момент выполнения инструмента — модель их не видит; сеть среды ограничена списком allowed hosts; для строгих контуров есть self-hosted sandboxes в собственном VPC и MCP tunnels, чтобы MCP-сервер не выходил в публичный интернет. Ещё из любопытного — outcomes: вы описываете рубрику успеха, а отдельный grader-агент перезапускает основного, пока критерии не выполнены. По сути это production-grade evals, встроенные прямо в runtime.

Финальный тезис авторов — harness стал ограничивающим фактором для того, что могут модели, — стоит читать с поправкой на рассказ о собственном продукте. Но мой вывод даже сильнее: обвязка перестаёт быть конкурентным преимуществом и становится скоропортящейся инфраструктурой, которую разумно арендовать. Своими стоит оставлять задачу, контекст, доменные знания и evals — слои, где живёт ваша ценность.

#AI4SDLC #AI #Agents #Architecture #PlatformEngineering #Evals #Engineering
Anthropic's Applied AI team on the Evolution of Agentic Surfaces
Sonnet 4.5 developed what Anthropic's Applied AI team came to call context anxiety: approaching its context window limit, it would wrap work up early and stop with room to spare. They built context resets into the harness to compensate. Then Opus 4.5 shipped without the behavior, and the fix turned ...

1.7k 0 36 16 9
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot