TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Инженер и Менеджер

1 Sep, 17:43

Открыть в Telegram Поделиться Пожаловаться

Claude Opus или GPT Sol?

Неправильный вопрос.

Но начнем немного издалека. Есть такая штука ARC-AGI-3. Это набор игр, в которых испытуемый ИИ должен победить. Правила не указаны, так что модельке придется додумать правила на ходу. Чем больше побед, тем больше баллов.

Обычный Claude Opus 5 набирает гордые 30%. А GPT Sol всего лишь 13%. И таки что, все бежим покупать Claude?

Не спешите.

—

NVidia взяла Opus 5 и засунула его в самописную агентскю систему AVO. Это типа Claude Code, но собраный у себя дома. В AVO входит агентская память, инструменты и всякое прочее. Есть даже агент-босс, который бьет цифровой палкой агента-исполнителя, чтобы тот быстрее работал.

Так вот, в рамках харнесса AVO та же модель Claude Opus 5 закрыла тест на все 100%!

И таки что, теперь-то бежим покупать Claude?

Нет, не спешите.

—

OpenAI вообще-то немного расстроились по поводу 13% и начали думать. Думали недолго, потому что в итоге изменили всего две вещи:
• Стали хранить reasoning модели между шагами, чтобы она запоминала правила
• Начали компактить длинный контекст.

И вуаля! Из 13% удалось выжать 38%. НА ТОЙ ЖЕ МОДЕЛИ.

И нет, бежать и покупать Opus не стоит. Дело вообще не в нем.

—

Все примеры выше вообще не про модели.

Эти примеры про обвязку вокруг модели. Харнесс. Он драматически влиял на и на успех работы модели, и на стоимость использования (потому что снижал кол-во output токенов, например).

А в реальном мире это работает?

Работает. Компания Databricks взяла и прогнала одинаковые модели через разные харнессы. Вот результаты, но одна и та же модель СИЛЬНО по-разному перформит на разном харнессе. Щелкните по ссылке, эта статья стоит ваших пяти минут.

Если вы прямо сейчас внедряете ИИ в вашу команду, вопрос Sol или Opus должен отходить на второй план и уступать место ключевому вопросу — что по харнессу? Где хранить контекст? Память? Тулзы?

Это, конечно, сильно сложнее, чем модельки выбирать.

1.6k 0 11 7 28
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot