TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Инженер и Менеджер

1 Sep, 17:43

Open in Telegram Share Report

Claude Opus или GPT Sol?

Неправильный вопрос.

Но начнем немного издалека. Есть такая штука ARC-AGI-3. Это набор игр, в которых испытуемый ИИ должен победить. Правила не указаны, так что модельке придется додумать правила на ходу. Чем больше побед, тем больше баллов.

Обычный Claude Opus 5 набирает гордые 30%. А GPT Sol всего лишь 13%. И таки что, все бежим покупать Claude?

Не спешите.

—

NVidia взяла Opus 5 и засунула его в самописную агентскю систему AVO. Это типа Claude Code, но собраный у себя дома. В AVO входит агентская память, инструменты и всякое прочее. Есть даже агент-босс, который бьет цифровой палкой агента-исполнителя, чтобы тот быстрее работал.

Так вот, в рамках харнесса AVO та же модель Claude Opus 5 закрыла тест на все 100%!

И таки что, теперь-то бежим покупать Claude?

Нет, не спешите.

—

OpenAI вообще-то немного расстроились по поводу 13% и начали думать. Думали недолго, потому что в итоге изменили всего две вещи:
• Стали хранить reasoning модели между шагами, чтобы она запоминала правила
• Начали компактить длинный контекст.

И вуаля! Из 13% удалось выжать 38%. НА ТОЙ ЖЕ МОДЕЛИ.

И нет, бежать и покупать Opus не стоит. Дело вообще не в нем.

—

Все примеры выше вообще не про модели.

Эти примеры про обвязку вокруг модели. Харнесс. Он драматически влиял на и на успех работы модели, и на стоимость использования (потому что снижал кол-во output токенов, например).

А в реальном мире это работает?

Работает. Компания Databricks взяла и прогнала одинаковые модели через разные харнессы. Вот результаты, но одна и та же модель СИЛЬНО по-разному перформит на разном харнессе. Щелкните по ссылке, эта статья стоит ваших пяти минут.

Если вы прямо сейчас внедряете ИИ в вашу команду, вопрос Sol или Opus должен отходить на второй план и уступать место ключевому вопросу — что по харнессу? Где хранить контекст? Память? Тулзы?

Это, конечно, сильно сложнее, чем модельки выбирать.

1.6k 0 11 7 28
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot