Что не так с Claude Opus 5?(TLDR: все так, просто почти никто не читает инструкции)
Вчера собирал материал для нового текста в подписку и Claude (Fable, не Opus) принес интересную историю. Для подписки она маловата, а вот сюда – в самый раз.
С самого релиза достаточно большая часть ИИ-сообщества возненавидела Claude Opus 5. В X и на Reddit модель ругают за лень, привычку писать стены текста и overengineering – строительство сложного кода там, где не нужно.
В итоге Anthropic добавили в Claude Code стиль вывода Concise, сокращающий длину ответов. В компании признали, что это – быстрая заплатка, а со стилем будут отдельно работать в следующих версиях модели.
Но самое интересное, что решение этой и других проблем давно лежало на поверхности – в
руководстве по промптингу Claude Opus 5 разработчики подсветили несколько проблем и рассказали, как с ними бороться. Руководства никто читать не любит, так что я сделал это для вас, не благодарите.
Проблема первая – болтливость модели. В Anthropic отмечают, что многие пытаются менять длину ответа изменением уровня рассуждений (Effort), хотя он регулирует совсем другое – количество вычислительных ресурсов, которые модель тратит на работу над ответом. Это совершенно другое: за коротким ответом (математический результат, например) могут стоять огромные вычисления.
В Anthropic рекомендуют запрашивать нужную длину вручную и даже дают следующую формулировку:
Ответы держи сфокусированными, короткими и сжатыми. Оговорки и дисклеймеры – коротко, основное место отдавай главному ответу. Когда просят объяснить – давай высокоуровневое резюме, если подробное объяснение не запрошено явно.
Ее можно вставить в пользовательский промпт, чтобы модель отвечала так всегда. Или добавлять в конец промпта для отдельных кейсов. Но обязательно поэкспериментируйте – меня, например, стиль ответов Opus 5 устраивает без промпта.
Проблема вторая – лишние перепроверки. Мы до сих пор часто пользуемся старыми промптами, в которые вписаны инструкции “перепроверь себя”, “работай по шагам” и так далее.
Opus 5 всегда сам перепроверяет свой ответ: если в промпте прописана еще одна перепроверка, то он тратит на нее лишние токены, почти не улучшая результат.
Я попросил Fable 5 вызвать Opus 5 субагентом и прогнать пять промптов в двух вариантах – с перепроверкой и без. В четырех случаях результат не изменился, при этом расход токенов вырос в 1,1–3,9 раза. В пятом случае была задача сократить текст до 40 слов: без перепроверки модель сократила до 44, с перепроверкой справилась — но расход токенов вырос в 56 раз. Это единичный выброс, а не норма, и сам эксперимент совсем короткий, я гонял его в фоне, пока писал этот пост.
Но мои наблюдения подтверждают и другие. Биргитта Бёкелер из Thoughtworks 10 августа опубликовала эксперимент: навязанный в промпте пошаговый процесс съедал в 3–8,5 раза больше токенов, а результат проигрывал в слепом ранжировании качества. Ее вывод – излишне подробно объяснять модели, как именно ей работать, больше не окупается.
Добавлю, что это не отменяет другого приема. Если сомневаетесь в ответе – скопируйте его в новый чат и попросите ИИ перепроверить там (или даже раскритиковать). При таком подходе модель смотрит на задачу “свежим взглядом” и часто находит проблемы.
Проблема третья – инструкции “сообщай только о важных проблемах”. Особенность Opus 5 и большинства современных моделей: они в принципе стали строго следовать инструкциям. И когда прописана такая инструкция, то Opus 5 реально начинает молчать о мелочах (например, небольших багах), что, накапливаясь, может вылиться в серьезные проблемы.
Решение – убрать инструкцию из промпта, а в некоторых случаях даже явно просить сообщать обо всех проблемах.
—
Кстати, излишняя детализация промптов – общая проблема большинства новых моделей, которую признают и Anthropic, и OpenAI. Летом даже стал популярен термин промпт-долга, когда старые промпты портят результат. Как с ним бороться, я рассказал в отдельном лонгриде.
80% инструкций – в мусор! Как теперь пишут промпты в OpenAI и Anthropic