А помните, как на анонсе слопуса 5 антропики показали, что в бенчмарке ARC-AGI-3 они выбили 30.2%, в то время как 5.6 смог всего на 7.8%? Так вот, как оказалось, есть нюанс с конфигурацией модели, и на самом деле 5.6 Sol выбивает 38.3%
В чем же, собственно, дело? Этот тяжелый для моделей бенчмарк основан на том что ей дается в управление какой-то интерактивный пазл и им надо его решить. А теперь вспомним что LLM это просто штука которая по последовательности токенов отвечает какой должен быть следующим и все эти итерации пазла это "вот все что было раньше, что дальше делаем?". Но т.к. антропик и опенаи отдают в ответе reasoning в виде короткого саммари (в отличие от китайских моделей) то каждая итерация в этом бенче заставляет модель снова размышлять про суть пазла снова и снова
Но если воспользоваться не апишкой эпохи GPT-3, а новой, то там, кроме видимых токенов, будет еще передан айдишник диалога, который позволяет модели не просто воспользоваться кешом (и удешевить процесс), но и взять оттуда исходный reasoning (вместо его саммари), что качественно влияет на процесс работы — модели не приходится на каждой итерации размышлять над сутью пазла
Второй же нюанс связан с размером контекста. Замечали же, что в то время, когда антропики раздают всем миллионный контекст по подписке (и берут деньги за fast режим), то опенаи раздают скорость даже по подписке, но длинный контекст только за удвоенный доллар? А все потому что они прямо говорят, что чем больше контекст тем хуже себя ведет модель, и лучше до такого не доводить
А тут еще прикол, что в ARC-AGI-3, когда упираешься в размер контекста, он начинает просто выкидывать начало диалога. В итоге у нас модель постоянно и вынуждена работать на неоптимально большом размере контекста, и вдобавок еще теряет то что было раньше. Но когда они включили поддержку compaction все стало сильно лучше. Причем если компакшен мы делаем не отдельным промптом (как было год назад), а через отдельную апишку, то оно в этом процессе тоже учитывает весь тот reasoning в сыром виде, что лежит в кеше (собственно поэтому сессии в кодексе и переживают несколько компактов подряд без ощущения что произошла лоботомия)
В итоге, пара оптимизаций и соленой смог выбить цифры в 3 раза потратив на это в 6 раз меньше токенов
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/