TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Делаю вид что разбираюсь

30 Jul, 14:37

Открыть в Telegram Поделиться Пожаловаться

А помните, как на анонсе слопуса 5 антропики показали, что в бенчмарке ARC-AGI-3 они выбили 30.2%, в то время как 5.6 смог всего на 7.8%? Так вот, как оказалось, есть нюанс с конфигурацией модели, и на самом деле 5.6 Sol выбивает 38.3%

В чем же, собственно, дело? Этот тяжелый для моделей бенчмарк основан на том что ей дается в управление какой-то интерактивный пазл и им надо его решить. А теперь вспомним что LLM это просто штука которая по последовательности токенов отвечает какой должен быть следующим и все эти итерации пазла это "вот все что было раньше, что дальше делаем?". Но т.к. антропик и опенаи отдают в ответе reasoning в виде короткого саммари (в отличие от китайских моделей) то каждая итерация в этом бенче заставляет модель снова размышлять про суть пазла снова и снова

Но если воспользоваться не апишкой эпохи GPT-3, а новой, то там, кроме видимых токенов, будет еще передан айдишник диалога, который позволяет модели не просто воспользоваться кешом (и удешевить процесс), но и взять оттуда исходный reasoning (вместо его саммари), что качественно влияет на процесс работы — модели не приходится на каждой итерации размышлять над сутью пазла

Второй же нюанс связан с размером контекста. Замечали же, что в то время, когда антропики раздают всем миллионный контекст по подписке (и берут деньги за fast режим), то опенаи раздают скорость даже по подписке, но длинный контекст только за удвоенный доллар? А все потому что они прямо говорят, что чем больше контекст тем хуже себя ведет модель, и лучше до такого не доводить

А тут еще прикол, что в ARC-AGI-3, когда упираешься в размер контекста, он начинает просто выкидывать начало диалога. В итоге у нас модель постоянно и вынуждена работать на неоптимально большом размере контекста, и вдобавок еще теряет то что было раньше. Но когда они включили поддержку compaction все стало сильно лучше. Причем если компакшен мы делаем не отдельным промптом (как было год назад), а через отдельную апишку, то оно в этом процессе тоже учитывает весь тот reasoning в сыром виде, что лежит в кеше (собственно поэтому сессии в кодексе и переживают несколько компактов подряд без ощущения что произошла лоботомия)

В итоге, пара оптимизаций и соленой смог выбить цифры в 3 раза потратив на это в 6 раз меньше токенов

https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
How enabling two settings tripled our scores on the ARC-AGI-3 benchmark
How two API settings improved GPT-5.6 performance on ARC-AGI-3, boosting scores and efficiency by retaining reasoning and enabling compaction.

581 0 1 12
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot