TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
phpclub.ru

25 Apr, 11:23

Открыть в Telegram Поделиться Пожаловаться

Александр ☭ Smirnov
Репост из: Поляков считает: AI, код и кейсы
Кажется, рабочий цикл с ИИ надо строить так, будто модель обвязка завтра станет хуже

Если вы тоже последние 2 месяца возмущались про то, что Claude стал тупее, то вот он, момент истины:

https://www.anthropic.com/engineering/april-23-postmortem

Anthropic опубликовал разбор: три независимых косяка в Claude Code, Agent SDK и Cowork и вуаля — сообщество негодует. Всё откатили, лимиты подписчикам сбросили.

🔭 Вот что было судя по материалу

1. Срезали глубину размышлений. Поменяли дефолтное reasoning effort с high на medium: быстрее, дешевле по лимитам, но слабее на сложных задачах. Кстати история с ризонингом очень влияет на качество работы в OpenClaw. Если ему случайно ризонинг не включить, останется очень бесполезный агент.

2. Сломали память внутри сессии. Хотели разово чистить рассуждения у простаивающих сессий — чистили на каждом ходу. Дозапрос во время вызова тулов мог даже выкинуть ризонинг текущего хода. Claude забывал, зачем делает текущие действия + выбирает не те тулы + кеш ломался и лимиты уходили быстрее. В целом управление контекстом и планированием, очистка его от мусора в моей практике — самая нетривиальная часть настройки агентов.

3. Бездумное ограничение в системном промпте. Добавили ограничение в 25 слов между вызовами инструментов. На одной из расширенных кодовых проверок эта строка дала просадку на 3% у Opus 4.6 и 4.7.

И вот тут важная часть: это не история про «какая-то компания облажалась». Это история про то, что агент — не монолитная магическая модель. Это стек из модели, системного промпта, кеша, ризонинга, тулов, CLI, лимитов и менеджмента контекста. Любой слой может тихо поменяться в худшую сторону.

🤔 О чем можно задуматься

В целом такие ситуации будут происходить регулярно. И не обязательно потому, что кто-то «специально делает модель тупее». Агентные продукты — это уже совсем не модель. Это слой промптов, кеша, тулов, лимитов, UX-решений и способов экономии вычислений. Эти слои будут постоянно крутить: ради скорости, стоимости, лимитов, новых моделей и снижения задержек.

Сейчас доступ к топ-моделям почти бесплатный. Claude Max за $200/мес даёт 16,67× лимита по неоффициальному разбору (исследование). Поставщики по сути выбрасывают деньги ради адопшена.

Окно закроется. Цены вырастут, лимиты прижмутся, обвязку будут крутить — то ради скорости, то ради экономии вычислений. Каждое движение — очередные «3% просадки качества кода», которые выльются в очередной тред на Реддит.

📌 Принципы рабочего цикла под нестабильную модель

🔸 Память — наружу. План, решения, ограничения, TODO и статус задач должны жить в файлах проекта, а не только в чате.

🔸 Ревью сторонним агентом В разборе прямо сказано: внутренний ревьюер на Opus 4.7 нашёл баг очистки кэша. На Opus 4.6 — не нашёл. Может конечно ультраревью сработало. Но критичный код лучше прогонять второй моделью, желательно от другого поставщика.

🔸 Декомпозиция вместо длинных сессий Маленькие задачи с явным входом и выходом. Длинная сессия — выше шанс словить баг вроде очистки рассуждений. Плюс есть хорошая привычка с rewind (esc+esc).

🔸 Системные требования — в репозиторий CLAUDE.md, AGENTS.md, README, тесты, линтеры, хуки. То, что лежит в проекте, переживает компакт и странности контекста.

Короче этот разбор антропиков говорит нам, что ИИ-агент — это нестабильный компонент системы. Получается что проектировать процессы надо под его отказы, а не под его суперспособности.


Главный вопрос. У вас Опус тоже тупел? Как выкручиваетесь от деградации моделей?

----

Поляков считает — AI, код и кейсы
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot