Artificial analysis (они зайки, делают лучшие бенчмарки сейчас) пишут про то, что изменилось:
1. Подрос общий индекс способностей модельки: SotA результаты на их бенчмарках при меньшем количестве использованных токенов, чем Opus 4.6 или GPT 5.2-xhigh, при этом скорость генерации сильно выше.
2. Почти вдвое уменьшили количество галлюцинаций (88%->50%), но при этом количество общих знаний у модели несопоставимо больше, чем у конкурентов.
3. Наконец-то доросли до фронтира по агентному кодингу.
1. Подрос общий индекс способностей модельки: SotA результаты на их бенчмарках при меньшем количестве использованных токенов, чем Opus 4.6 или GPT 5.2-xhigh, при этом скорость генерации сильно выше.
2. Почти вдвое уменьшили количество галлюцинаций (88%->50%), но при этом количество общих знаний у модели несопоставимо больше, чем у конкурентов.
3. Наконец-то доросли до фронтира по агентному кодингу.