🧮 Sonnet 5.5: «дешевле на 30%» — это меньше токенов, а не скидка на цену
Anthropic выпустила Claude Sonnet 5.5, вторую модель семьи 5.5. Вендор обещает вывод на 30%+ быстрее и экономию до 30% на задаче, почти догоняя топовый Opus 5.5 на тестах разработки и офисной работы. Цена за миллион токенов при этом не изменилась ни на цент.
Что заявляет вендор
На Terminal-Bench 4.0 (тест на самостоятельную работу в терминале) заявлен скачок с 10,3% до 70,6%. На GDPval-AA (тест офисных задач из 44 профессий) Sonnet 5.5 набирает 1844 очка против 1846 у Opus 5.5 — разница почти нулевая и на 400 очков выше предшественника.
Экономия получается не от снижения цены токена, а от того, что модель тратит меньше токенов на ту же задачу: цена как у Sonnet 5 — $2 за миллион входных токенов, $10 за миллион выходных.
Независимый замер
Artificial Analysis ставит Sonnet 5.5 на 3-е место из 216 моделей с индексом 56. По GDPval-AA независимый замер выдал 1844,21 — почти точное совпадение с цифрой вендора. А вот Terminal-Bench 4.0 разошёлся: вендор говорит 70,6%, у Artificial Analysis — 63,6%, разница почти 7 пунктов, методики прогона не совпадают. По скорости модель заняла лишь 30-е место из 216 (138,7 токена в секунду) — «быстрее на 30%» верно относительно предыдущего Sonnet, а не относительно рынка.
Что говорят внедрившие
CNBC приводит слова продакт-менеджера Anthropic Тео Чу: Sonnet — модель «для клиента, который считает деньги и не всегда нуждается в максимальном интеллекте». AWS в своём блоге советует ставить Sonnet 5.5 на постоянные фоновые задачи — мониторинг алертов, генерацию SQL, тестирование интерфейсов, а решения с суждением оставлять Opus 5.5.
Чего в материале нет
Не указан размер выборки задач, на которых посчитали «до 30% дешевле» — формулировка «до» намекает на диапазон, а не фиксированное число. Прямого сопоставления цены с моделями Gemini нет: на странице тарифов Google цифры за миллион токенов текстовых моделей не опубликованы вовсе. Саймон Уиллисон в своём тесте отметил, что при максимальном режиме размышлений модель тратит 128 тысяч токенов и не успевает выдать результат — предсказуемость экономии не гарантирована.
Почему это важно
Экономия реальна там, где задача типовая и повторяющаяся: фикс багов, генерация SQL, слайды по шаблону — модели требуется меньше шагов на то же самое. Для разовой сложной задачи число токенов не падает, и по данным CNBC дешевле в такой момент остаться на Opus 5.5, который стоит вдвое дороже, но даёт надёжнее суждение. Выгода исчезает при включённом режиме максимального усилия: там модель уходит в проверки через вспомогательные подпроцессы и может превысить бюджет задачи.
🔗 Источники: The Decoder · Anthropic · CNBC Tech · Simon Willison
💬 Telegram | 💬 MAX
#разбор #claude #агенты
Anthropic выпустила Claude Sonnet 5.5, вторую модель семьи 5.5. Вендор обещает вывод на 30%+ быстрее и экономию до 30% на задаче, почти догоняя топовый Opus 5.5 на тестах разработки и офисной работы. Цена за миллион токенов при этом не изменилась ни на цент.
Что заявляет вендор
На Terminal-Bench 4.0 (тест на самостоятельную работу в терминале) заявлен скачок с 10,3% до 70,6%. На GDPval-AA (тест офисных задач из 44 профессий) Sonnet 5.5 набирает 1844 очка против 1846 у Opus 5.5 — разница почти нулевая и на 400 очков выше предшественника.
«Работает на 30%+ быстрее и стоит до 30% дешевле для большинства задач»
Экономия получается не от снижения цены токена, а от того, что модель тратит меньше токенов на ту же задачу: цена как у Sonnet 5 — $2 за миллион входных токенов, $10 за миллион выходных.
Независимый замер
Artificial Analysis ставит Sonnet 5.5 на 3-е место из 216 моделей с индексом 56. По GDPval-AA независимый замер выдал 1844,21 — почти точное совпадение с цифрой вендора. А вот Terminal-Bench 4.0 разошёлся: вендор говорит 70,6%, у Artificial Analysis — 63,6%, разница почти 7 пунктов, методики прогона не совпадают. По скорости модель заняла лишь 30-е место из 216 (138,7 токена в секунду) — «быстрее на 30%» верно относительно предыдущего Sonnet, а не относительно рынка.
Что говорят внедрившие
CNBC приводит слова продакт-менеджера Anthropic Тео Чу: Sonnet — модель «для клиента, который считает деньги и не всегда нуждается в максимальном интеллекте». AWS в своём блоге советует ставить Sonnet 5.5 на постоянные фоновые задачи — мониторинг алертов, генерацию SQL, тестирование интерфейсов, а решения с суждением оставлять Opus 5.5.
Чего в материале нет
Не указан размер выборки задач, на которых посчитали «до 30% дешевле» — формулировка «до» намекает на диапазон, а не фиксированное число. Прямого сопоставления цены с моделями Gemini нет: на странице тарифов Google цифры за миллион токенов текстовых моделей не опубликованы вовсе. Саймон Уиллисон в своём тесте отметил, что при максимальном режиме размышлений модель тратит 128 тысяч токенов и не успевает выдать результат — предсказуемость экономии не гарантирована.
Почему это важно
Экономия реальна там, где задача типовая и повторяющаяся: фикс багов, генерация SQL, слайды по шаблону — модели требуется меньше шагов на то же самое. Для разовой сложной задачи число токенов не падает, и по данным CNBC дешевле в такой момент остаться на Opus 5.5, который стоит вдвое дороже, но даёт надёжнее суждение. Выгода исчезает при включённом режиме максимального усилия: там модель уходит в проверки через вспомогательные подпроцессы и может превысить бюджет задачи.
🔗 Источники: The Decoder · Anthropic · CNBC Tech · Simon Willison
💬 Telegram | 💬 MAX
#разбор #claude #агенты