TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Саша Раковский

28 Aug, 07:33

Открыть в Telegram Поделиться Пожаловаться

Репост из: сбежавшая нейросеть
Что не так с Claude Opus 5?

(TLDR: все так, просто почти никто не читает инструкции)

Вчера собирал материал для нового текста в подписку и Claude (Fable, не Opus) принес интересную историю. Для подписки она маловата, а вот сюда – в самый раз.

С самого релиза достаточно большая часть ИИ-сообщества возненавидела Claude Opus 5. В X и на Reddit модель ругают за лень, привычку писать стены текста и overengineering – строительство сложного кода там, где не нужно.

В итоге Anthropic добавили в Claude Code стиль вывода Concise, сокращающий длину ответов. В компании признали, что это – быстрая заплатка, а со стилем будут отдельно работать в следующих версиях модели.

Но самое интересное, что решение этой и других проблем давно лежало на поверхности – в руководстве по промптингу Claude Opus 5 разработчики подсветили несколько проблем и рассказали, как с ними бороться. Руководства никто читать не любит, так что я сделал это для вас, не благодарите.

Проблема первая – болтливость модели. В Anthropic отмечают, что многие пытаются менять длину ответа изменением уровня рассуждений (Effort), хотя он регулирует совсем другое – количество вычислительных ресурсов, которые модель тратит на работу над ответом. Это совершенно другое: за коротким ответом (математический результат, например) могут стоять огромные вычисления.

В Anthropic рекомендуют запрашивать нужную длину вручную и даже дают следующую формулировку:

Ответы держи сфокусированными, короткими и сжатыми. Оговорки и дисклеймеры – коротко, основное место отдавай главному ответу. Когда просят объяснить – давай высокоуровневое резюме, если подробное объяснение не запрошено явно.


Ее можно вставить в пользовательский промпт, чтобы модель отвечала так всегда. Или добавлять в конец промпта для отдельных кейсов. Но обязательно поэкспериментируйте – меня, например, стиль ответов Opus 5 устраивает без промпта.

Проблема вторая – лишние перепроверки. Мы до сих пор часто пользуемся старыми промптами, в которые вписаны инструкции “перепроверь себя”, “работай по шагам” и так далее.

Opus 5 всегда сам перепроверяет свой ответ: если в промпте прописана еще одна перепроверка, то он тратит на нее лишние токены, почти не улучшая результат. 

Я попросил Fable 5 вызвать Opus 5 субагентом и прогнать пять промптов в двух вариантах – с перепроверкой и без. В четырех случаях результат не изменился, при этом расход токенов вырос в 1,1–3,9 раза. В пятом случае была задача сократить текст до 40 слов: без перепроверки модель сократила до 44, с перепроверкой справилась — но расход токенов вырос в 56 раз. Это единичный выброс, а не норма, и сам эксперимент совсем короткий, я гонял его в фоне, пока писал этот пост.

Но мои наблюдения подтверждают и другие. Биргитта Бёкелер из Thoughtworks 10 августа опубликовала эксперимент: навязанный в промпте пошаговый процесс съедал в 3–8,5 раза больше токенов, а результат проигрывал в слепом ранжировании качества. Ее вывод – излишне подробно объяснять модели, как именно ей работать, больше не окупается.

Добавлю, что это не отменяет другого приема. Если сомневаетесь в ответе – скопируйте его в новый чат и попросите ИИ перепроверить там (или даже раскритиковать). При таком подходе модель смотрит на задачу “свежим взглядом” и часто находит проблемы.

Проблема третья – инструкции “сообщай только о важных проблемах”. Особенность Opus 5 и большинства современных моделей: они в принципе стали строго следовать инструкциям. И когда прописана такая инструкция, то Opus 5 реально начинает молчать о мелочах (например, небольших багах), что, накапливаясь, может вылиться в серьезные проблемы.

Решение – убрать инструкцию из промпта, а в некоторых случаях даже явно просить сообщать обо всех проблемах. 
—
Кстати, излишняя детализация промптов – общая проблема большинства новых моделей, которую признают и Anthropic, и OpenAI. Летом даже стал популярен термин промпт-долга, когда старые промпты портят результат. Как с ним бороться, я рассказал в отдельном лонгриде.

80% инструкций – в мусор! Как теперь пишут промпты в OpenAI и Anthropic

965 0 6 3 14
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot