TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
сбежавшая нейросеть

22 Sep, 21:03

Открыть в Telegram Поделиться Пожаловаться

Prev Next
Opus 5.5: замедляем ускоряем фронтир

Итак, Claude Fable 5.1 продержалась на посту флагмана Anthropic всего три недели – вышедший сегодня Opus 5.5 обходит ее почти во всех бенчмарках и выглядит сильным соперником для GPT-6 Astra. Особенно впечатляюще смотрится скачок в индексе Artificial Analysis: с 53 баллов у GPT-6 и Fable 5.1 до 58 баллов у Opus 5.5.

Подробный разбор бенчмарков я в этот раз вынес на картинку (ее рисовал уже Opus 5.5), в тексте отмечу только самое важное. Главный отрыв – в офисной работе: документы, таблицы, презентации. Здесь рейтинг ставит Opus 5.5 далеко впереди и Fable 5.1, и GPT-6. В программировании картина скромнее: по данным Anthropic модель уходит в отрыв, но в независимом замере идет с GPT-6 вровень. А в научных задачах и автоматизации бизнес-процессов GPT-6 пока впереди.

При этом Opus 5.5 стоит $4 за миллион токенов на входе и $20 на выходе – на 20% дешевле Opus 5 и в 2,5 раза дешевле Fable 5.1 и GPT-6.

У индекса Artificial Analysis есть проблема – в текущей версии он состоит из бенчмарков, которые замеряют умение отвечать на вопросы, работать с документами и в терминале, а задачи, связанные, например, с компьютерным зрением, в него не входят. Этим, кстати, отчасти объясняется паритет GPT-6 с Fable 5.1.

Впрочем, с компьютерным зрением у Opus 5.5 тоже все отлично – именно здесь у модели самый резкий скачок. На редких профессиональных графиках – биржевых свечах, потоковых диаграммах, розах ветров – Opus 5.5 без вспомогательных инструментов решает 64% задач, против 30% у Opus 5 и 45% у Fable 5.1. Даже в самом дешевом режиме, за пару центов за задачу, модель читает графики точнее, чем Fable на любых настройках. Anthropic приводит и бытовые примеры: модель теперь понимает, какие блоки соединяет стрелка на схеме и во сколько начинается встреча на скриншоте календаря.

По снимкам детали Opus 5.5 пишет код ее 3D-модели и здесь сравнялся с GPT-6, у которой пространственное мышление было главным козырем. А за компьютером, работая по скриншотам, доводит до конца почти половину задач – 49% против 37% у Opus 5.

Для подписчиков Anthropic подняла пятичасовые лимиты на Pro, Max и Team, также подарила один ручной сброс лимитов – его надо использовать до 22 октября. Меня же радует, что на планах Max на новинку можно тратить все 100% недельного лимита, в отличие от 50% на Fable 5.1. С учетом того, что по бенчмаркам не видно ни одного кейса, где Fable 5.1 лучше Opus 5.5, получается, что подписка Max разом стала в два раза эффективнее.

На максимальных настройках Opus 5.5 думает заметно дольше предшественника и тратит в 1,6 раза больше токенов – в итоге задача обходится примерно в те же деньги, что и у Opus 5, и лимит сгорает так же быстро.

По замерам Artificial Analysis, выгода начинается на ступеньку ниже: на уровне high новая модель показывает результат Fable 5.1 на максимуме примерно за четверть цены. Недаром по умолчанию Anthropic ставит пользователям medium, а в руководстве советует сначала опробовать модель на этом уровне, повышая лимит рассуждений только тогда, когда недовольны результатом.

Opus 5.5 – первый релиз Anthropic после того, как Дарио Амодеи призвал замедлить гонку передовых моделей. Вышла модель дешевле, быстрее и с большими лимитами, а в ее системной карточке приводится оценка: ИИ уже ускоряет разработку новых моделей примерно в полтора раза.

При этом по безопасности Opus 5.5 – лучшая модель компании. В автоматическом аудите она обошла все недавние Claude почти по всем видам нежелательного поведения и оказалась самой честной. Попыток выйти за пределы «песочницы» у нее на 85% меньше, чем у Opus 5 и Mythos 5.1, а перед рискованным действием она чаще спрашивает разрешения у пользователя.

В общем, анонсом я доволен. Anthropic уже пообещала выпустить Sonnet 5.5 и Haiku 5.5, плюс что-то надо делать с Fable – при нынешнем темпе это “странный флагман на три недели”.

—
Своим опытом работы с ИИ я делюсь в подписке. Недавно там вышел лонгрид, как выжимать максимум из GPT-6 и Fable 5.1 – изложенные в нем базовые правила подойдут и для Opus 5.5.

— Читать на “Бусти”
— Читать на Sponsr

5.6k 0 83 90
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot