TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Саша Раковский

28 Aug, 07:33

Open in Telegram Share Report

Forward from: сбежавшая нейросеть
Что не так с Claude Opus 5?

(TLDR: все так, просто почти никто не читает инструкции)

Вчера собирал материал для нового текста в подписку и Claude (Fable, не Opus) принес интересную историю. Для подписки она маловата, а вот сюда – в самый раз.

С самого релиза достаточно большая часть ИИ-сообщества возненавидела Claude Opus 5. В X и на Reddit модель ругают за лень, привычку писать стены текста и overengineering – строительство сложного кода там, где не нужно.

В итоге Anthropic добавили в Claude Code стиль вывода Concise, сокращающий длину ответов. В компании признали, что это – быстрая заплатка, а со стилем будут отдельно работать в следующих версиях модели.

Но самое интересное, что решение этой и других проблем давно лежало на поверхности – в руководстве по промптингу Claude Opus 5 разработчики подсветили несколько проблем и рассказали, как с ними бороться. Руководства никто читать не любит, так что я сделал это для вас, не благодарите.

Проблема первая – болтливость модели. В Anthropic отмечают, что многие пытаются менять длину ответа изменением уровня рассуждений (Effort), хотя он регулирует совсем другое – количество вычислительных ресурсов, которые модель тратит на работу над ответом. Это совершенно другое: за коротким ответом (математический результат, например) могут стоять огромные вычисления.

В Anthropic рекомендуют запрашивать нужную длину вручную и даже дают следующую формулировку:

Ответы держи сфокусированными, короткими и сжатыми. Оговорки и дисклеймеры – коротко, основное место отдавай главному ответу. Когда просят объяснить – давай высокоуровневое резюме, если подробное объяснение не запрошено явно.


Ее можно вставить в пользовательский промпт, чтобы модель отвечала так всегда. Или добавлять в конец промпта для отдельных кейсов. Но обязательно поэкспериментируйте – меня, например, стиль ответов Opus 5 устраивает без промпта.

Проблема вторая – лишние перепроверки. Мы до сих пор часто пользуемся старыми промптами, в которые вписаны инструкции “перепроверь себя”, “работай по шагам” и так далее.

Opus 5 всегда сам перепроверяет свой ответ: если в промпте прописана еще одна перепроверка, то он тратит на нее лишние токены, почти не улучшая результат. 

Я попросил Fable 5 вызвать Opus 5 субагентом и прогнать пять промптов в двух вариантах – с перепроверкой и без. В четырех случаях результат не изменился, при этом расход токенов вырос в 1,1–3,9 раза. В пятом случае была задача сократить текст до 40 слов: без перепроверки модель сократила до 44, с перепроверкой справилась — но расход токенов вырос в 56 раз. Это единичный выброс, а не норма, и сам эксперимент совсем короткий, я гонял его в фоне, пока писал этот пост.

Но мои наблюдения подтверждают и другие. Биргитта Бёкелер из Thoughtworks 10 августа опубликовала эксперимент: навязанный в промпте пошаговый процесс съедал в 3–8,5 раза больше токенов, а результат проигрывал в слепом ранжировании качества. Ее вывод – излишне подробно объяснять модели, как именно ей работать, больше не окупается.

Добавлю, что это не отменяет другого приема. Если сомневаетесь в ответе – скопируйте его в новый чат и попросите ИИ перепроверить там (или даже раскритиковать). При таком подходе модель смотрит на задачу “свежим взглядом” и часто находит проблемы.

Проблема третья – инструкции “сообщай только о важных проблемах”. Особенность Opus 5 и большинства современных моделей: они в принципе стали строго следовать инструкциям. И когда прописана такая инструкция, то Opus 5 реально начинает молчать о мелочах (например, небольших багах), что, накапливаясь, может вылиться в серьезные проблемы.

Решение – убрать инструкцию из промпта, а в некоторых случаях даже явно просить сообщать обо всех проблемах. 
—
Кстати, излишняя детализация промптов – общая проблема большинства новых моделей, которую признают и Anthropic, и OpenAI. Летом даже стал популярен термин промпт-долга, когда старые промпты портят результат. Как с ним бороться, я рассказал в отдельном лонгриде.

80% инструкций – в мусор! Как теперь пишут промпты в OpenAI и Anthropic

965 0 6 3 14
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot