TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
сбежавшая нейросеть

24 Jul, 21:10

Telegram'da ochish Ulashish Shikoyat qilish

Opus 5 – новый флагман Anthropic

Вышел Opus 5, в большинстве бенчмарков он обходит Fable 5, но удивительного здесь нет. По слухам, первые версии Claude Mythos (на ней строится коммерческая Fable 5) были доступны сотрудникам Anthropic в феврале, закрытый Project Glasswing стартовал в апреле, а Fable 5 попробовали выпустить в начале июня – но из-за вмешательства властей США отложили.

Пять месяцев – более чем достаточно, чтобы из архитектуры топовой модели собрать “массовый флагман”, каким и является Opus 5.

Из бенчмарков бросается в глаза ARC-AGI-3 с результатом 30,2% против 7,8% у прошлого лидера – GPT-5.6 Sol. Это бенчмарк на абстрактное мышление: в нем модель оказывается внутри пошаговой игры, вообще без объяснений, как ее проходить. Методом проб и ошибок ИИ должен понять правила игры, а затем выиграть. Игр в бенчмарке много, каждая – со своими особенностями.

Бенчмарк сложный, но вот что интересно. ARC-AGI-3 представили 25 марта – явно раньше, чем началось обучение Opus 5. И это позволяет сказать, что в Anthropic, изучив доступные задачи бенчмарка (их минимум, большинство держат в секрете), попробовали натаскать новую модель на него.

Официально про это нигде не говорится, но это было бы логично, более того, это, возможно, уже дало положительный эффект: для прохождения ARC-AGI-3 нужна “сообразительность” и ее Opus 5 проявляет и в других сферах.

Блогпост Anthropic описывает ситуацию, как Opus 5 дали файл с чертежом механической детали с задачей написать программу, которая соберет эту деталь во FreeCAD. При отключили модели компьютерное зрение – то есть файл с чертежом был, но посмотреть его не получалось.

Другие ИИ в такой ситуации останавливались и сообщали, что не могут выполнить задачу. Opus 5 открыл файл как то, чем картинка является на самом деле, – длинную таблицу чисел, по три штуки на каждую точку экрана. И написал с нуля собственную программу, которая по этим числам находит прямые линии, окружности, размерные стрелки. То есть смастерил простенькое “компьютерное зрение” сам.

Если говорить про другие бенчмарки, то отрыв от Fable 5 реальный в трех местах, зато важных: агентское программирование (43,3 против 33,7), бизнес-задачи (26,0 против 17,4) и работа за компьютером (70,6 против 66,1). Это задачи, где модель пашет долго и без присмотра.

Остальное — размен: на HLE 56,3 против 56,5, на двух кодовых бенчмарках отставание в десятые доли. Проигрывает заметно только в юриспруденции и медицине. Это именно тот уровень прогресса, который я и ожидал от Opus 5 за такое время.

При этом модель в два раза дешевле Fable 5, доступна на базовой подписке Pro, а на подписках Max на нее можно тратить весь лимит, а не 50%. Если не будет какого-то косяка в виде кривого стиля или высокого уровня галлюцинаций – Fable 5 можно отправлять на пенсию до выхода 5.1.

Еще интересный факт. Mythos/Fable 5 в свое время перепугал и разработчиков, и даже власти США из-за крутых возможностей по поиску уязвимостей. Opus 5 намеренно не стали обучать кибербезопасности – но в бенчмарке на поиск уязвимостей она все равно набрала 79,4% против 80% у Mythos. Я как-то писал об этом: если учить модель хорошо писать код – она автоматом учится искать уязвимости.

В Anthropic предупредили, что у Opus 5, как и у Fable 5, будет fallback-механизм, переключающий на Opus 4.8 запросы, которые покажутся опасными. Но настроен он, судя по всему, намного лучше: если Fable 5 у меня отказывалась отвечать на такие безобидные промпты, как “дай свое объяснение парадоксу Ферми” или “объясни, как устроен мозг осьминога”, то Opus 5 сейчас на все ответил.

Параллельно прогнал модель еще на нескольких запросах – понравилось, как Opus 5 делает веб-дизайн, ищет в сети и генерит идеи. Стиль письма своеобразный, это еще надо тестить.
–
Друзья, традиционно по пятницам я выпускаю новый лонгрид в подписке. Он уже на месте, но подробно представлю завтра. Но если кому не терпится, это лонгрид по мотивам рекомендаций Бориса Черни о том, как пятью этапами стать профессионалом в ИИ.

Читаем здесь:
— Бусти
— Sponsr

12.5k 5 130 134
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot