Александр ☭ Smirnov
Репост из: Поляков считает: AI, код и кейсы
Кажется, рабочий цикл с ИИ надо строить так, будто модель обвязка завтра станет хуже
Если вы тоже последние 2 месяца возмущались про то, что Claude стал тупее, то вот он, момент истины:
https://www.anthropic.com/engineering/april-23-postmortem
Anthropic опубликовал разбор: три независимых косяка в Claude Code, Agent SDK и Cowork и вуаля — сообщество негодует. Всё откатили, лимиты подписчикам сбросили.
🔭 Вот что было судя по материалу
1. Срезали глубину размышлений. Поменяли дефолтное reasoning effort с high на medium: быстрее, дешевле по лимитам, но слабее на сложных задачах. Кстати история с ризонингом очень влияет на качество работы в OpenClaw. Если ему случайно ризонинг не включить, останется очень бесполезный агент.
2. Сломали память внутри сессии. Хотели разово чистить рассуждения у простаивающих сессий — чистили на каждом ходу. Дозапрос во время вызова тулов мог даже выкинуть ризонинг текущего хода. Claude забывал, зачем делает текущие действия + выбирает не те тулы + кеш ломался и лимиты уходили быстрее. В целом управление контекстом и планированием, очистка его от мусора в моей практике — самая нетривиальная часть настройки агентов.
3. Бездумное ограничение в системном промпте. Добавили ограничение в 25 слов между вызовами инструментов. На одной из расширенных кодовых проверок эта строка дала просадку на 3% у Opus 4.6 и 4.7.
И вот тут важная часть: это не история про «какая-то компания облажалась». Это история про то, что агент — не монолитная магическая модель. Это стек из модели, системного промпта, кеша, ризонинга, тулов, CLI, лимитов и менеджмента контекста. Любой слой может тихо поменяться в худшую сторону.
🤔 О чем можно задуматься
В целом такие ситуации будут происходить регулярно. И не обязательно потому, что кто-то «специально делает модель тупее». Агентные продукты — это уже совсем не модель. Это слой промптов, кеша, тулов, лимитов, UX-решений и способов экономии вычислений. Эти слои будут постоянно крутить: ради скорости, стоимости, лимитов, новых моделей и снижения задержек.
Сейчас доступ к топ-моделям почти бесплатный. Claude Max за $200/мес даёт 16,67× лимита по неоффициальному разбору (исследование). Поставщики по сути выбрасывают деньги ради адопшена.
Окно закроется. Цены вырастут, лимиты прижмутся, обвязку будут крутить — то ради скорости, то ради экономии вычислений. Каждое движение — очередные «3% просадки качества кода», которые выльются в очередной тред на Реддит.
📌 Принципы рабочего цикла под нестабильную модель
🔸 Память — наружу. План, решения, ограничения, TODO и статус задач должны жить в файлах проекта, а не только в чате.
🔸 Ревью сторонним агентом В разборе прямо сказано: внутренний ревьюер на Opus 4.7 нашёл баг очистки кэша. На Opus 4.6 — не нашёл. Может конечно ультраревью сработало. Но критичный код лучше прогонять второй моделью, желательно от другого поставщика.
🔸 Декомпозиция вместо длинных сессий Маленькие задачи с явным входом и выходом. Длинная сессия — выше шанс словить баг вроде очистки рассуждений. Плюс есть хорошая привычка с rewind (esc+esc).
🔸 Системные требования — в репозиторий CLAUDE.md, AGENTS.md, README, тесты, линтеры, хуки. То, что лежит в проекте, переживает компакт и странности контекста.
Главный вопрос. У вас Опус тоже тупел? Как выкручиваетесь от деградации моделей?
----
Поляков считает — AI, код и кейсы
Если вы тоже последние 2 месяца возмущались про то, что Claude стал тупее, то вот он, момент истины:
https://www.anthropic.com/engineering/april-23-postmortem
Anthropic опубликовал разбор: три независимых косяка в Claude Code, Agent SDK и Cowork и вуаля — сообщество негодует. Всё откатили, лимиты подписчикам сбросили.
🔭 Вот что было судя по материалу
1. Срезали глубину размышлений. Поменяли дефолтное reasoning effort с high на medium: быстрее, дешевле по лимитам, но слабее на сложных задачах. Кстати история с ризонингом очень влияет на качество работы в OpenClaw. Если ему случайно ризонинг не включить, останется очень бесполезный агент.
2. Сломали память внутри сессии. Хотели разово чистить рассуждения у простаивающих сессий — чистили на каждом ходу. Дозапрос во время вызова тулов мог даже выкинуть ризонинг текущего хода. Claude забывал, зачем делает текущие действия + выбирает не те тулы + кеш ломался и лимиты уходили быстрее. В целом управление контекстом и планированием, очистка его от мусора в моей практике — самая нетривиальная часть настройки агентов.
3. Бездумное ограничение в системном промпте. Добавили ограничение в 25 слов между вызовами инструментов. На одной из расширенных кодовых проверок эта строка дала просадку на 3% у Opus 4.6 и 4.7.
И вот тут важная часть: это не история про «какая-то компания облажалась». Это история про то, что агент — не монолитная магическая модель. Это стек из модели, системного промпта, кеша, ризонинга, тулов, CLI, лимитов и менеджмента контекста. Любой слой может тихо поменяться в худшую сторону.
🤔 О чем можно задуматься
В целом такие ситуации будут происходить регулярно. И не обязательно потому, что кто-то «специально делает модель тупее». Агентные продукты — это уже совсем не модель. Это слой промптов, кеша, тулов, лимитов, UX-решений и способов экономии вычислений. Эти слои будут постоянно крутить: ради скорости, стоимости, лимитов, новых моделей и снижения задержек.
Сейчас доступ к топ-моделям почти бесплатный. Claude Max за $200/мес даёт 16,67× лимита по неоффициальному разбору (исследование). Поставщики по сути выбрасывают деньги ради адопшена.
Окно закроется. Цены вырастут, лимиты прижмутся, обвязку будут крутить — то ради скорости, то ради экономии вычислений. Каждое движение — очередные «3% просадки качества кода», которые выльются в очередной тред на Реддит.
📌 Принципы рабочего цикла под нестабильную модель
🔸 Память — наружу. План, решения, ограничения, TODO и статус задач должны жить в файлах проекта, а не только в чате.
🔸 Ревью сторонним агентом В разборе прямо сказано: внутренний ревьюер на Opus 4.7 нашёл баг очистки кэша. На Opus 4.6 — не нашёл. Может конечно ультраревью сработало. Но критичный код лучше прогонять второй моделью, желательно от другого поставщика.
🔸 Декомпозиция вместо длинных сессий Маленькие задачи с явным входом и выходом. Длинная сессия — выше шанс словить баг вроде очистки рассуждений. Плюс есть хорошая привычка с rewind (esc+esc).
🔸 Системные требования — в репозиторий CLAUDE.md, AGENTS.md, README, тесты, линтеры, хуки. То, что лежит в проекте, переживает компакт и странности контекста.
Короче этот разбор антропиков говорит нам, что ИИ-агент — это нестабильный компонент системы. Получается что проектировать процессы надо под его отказы, а не под его суперспособности.
Главный вопрос. У вас Опус тоже тупел? Как выкручиваетесь от деградации моделей?
----
Поляков считает — AI, код и кейсы