Anthropic выпустили Sonnet 4.6 - сейчас самое лучшее для агентов: дешевле, умнее, надёжнее
Anthropic снова сделали то, что конкуренты OpenAI, Google, китайцы пока не повторили в таком балансе цена/качество/надёжность.
Почему именно самая лучшая модель прямо сейчас?
- Почти догнала топ-модель Opus 4.6, но стоит в 5 раз дешевле
Цена та же, что у предыдущего Sonnet: $3 за миллион входных токенов / $15 за выходные (Opus — $5/$25).
→ Экономия огромная, особенно когда агент работает часами или обрабатывает тысячи запросов.
- Агентные задачи — на уровне лидера рынка
- Computer use: 72.5% на OSWorld-Verified — почти как у Opus (72.7%).
- Coding + реальные фиксы: 79.6% на SWE-bench Verified — всего на 1.2% ниже Opus.
- Офисные / профессиональные задачи: 1633 Elo на GDPval-AA — даже обошла Opus (1606)!
Это значит, что агент может сам искать инфу в вебе, писать код, исправлять баги, заполнять отчёты, анализировать финансы и реже галлюцинировать.
Крутые фичи для агентов из коробки (всё в general availability):
- Сам фильтрует веб-результаты кодом → +13% точности, -32% токенов.
- Долгосрочная память между сессиями.
- Поиск среди тысяч инструментов (не грузит всё в контекст).
- Вызов инструментов через код (чисто и дёшево).
- Контекст до 1 миллиона токенов (beta) — целая книга или огромный проект в одном запросе.
Anthropic снова сделали то, что конкуренты OpenAI, Google, китайцы пока не повторили в таком балансе цена/качество/надёжность.
Почему именно самая лучшая модель прямо сейчас?
- Почти догнала топ-модель Opus 4.6, но стоит в 5 раз дешевле
Цена та же, что у предыдущего Sonnet: $3 за миллион входных токенов / $15 за выходные (Opus — $5/$25).
→ Экономия огромная, особенно когда агент работает часами или обрабатывает тысячи запросов.
- Агентные задачи — на уровне лидера рынка
- Computer use: 72.5% на OSWorld-Verified — почти как у Opus (72.7%).
- Coding + реальные фиксы: 79.6% на SWE-bench Verified — всего на 1.2% ниже Opus.
- Офисные / профессиональные задачи: 1633 Elo на GDPval-AA — даже обошла Opus (1606)!
Это значит, что агент может сам искать инфу в вебе, писать код, исправлять баги, заполнять отчёты, анализировать финансы и реже галлюцинировать.
Крутые фичи для агентов из коробки (всё в general availability):
- Сам фильтрует веб-результаты кодом → +13% точности, -32% токенов.
- Долгосрочная память между сессиями.
- Поиск среди тысяч инструментов (не грузит всё в контекст).
- Вызов инструментов через код (чисто и дёшево).
- Контекст до 1 миллиона токенов (beta) — целая книга или огромный проект в одном запросе.