😵OPUS 5.5 РЕАЛЬНО ПЕРЕЕХАЛ ASTRA?
За последние пару дней вышли GPT-6 Sol, Grok 4.7 и Claude Opus 5.5, и я сначала думал что Astra ещё какое-то время спокойно останется самым жирным вариантом под сложный кодинг
Но Opus 5.5 прям удивил
Причём Anthropic отдельно показывает что на FrontierCode Opus 5.5 даже на среднем thinking обгоняет лучший результат Astra примерно за 1/5 стоимости задачи. Не везде, конечно: в AutomationBench Astra пока впереди 41.4% против 40%, по scientific задачам тоже сильнее
GPT-6 Sol на этом фоне выглядит как более адекватная Astra на каждый день. Контекст те же 1.05M, output до 128k, а API всего $2 / $10. Для обычного вайбкодинга мне сейчас намного логичнее сначала открыть Sol и уже самые тяжёлые задачи кидать в Astra или Opus
Grok 4.7 тоже сильно вырос: CursorBench 46.3% против 40.4% у 4.6, DeepSWE 71%, Terminal-Bench 38% против 20.3%. При этом API оставили $2 / $6, поэтому по цене он вообще выглядит интересно
Короче сейчас у меня впервые нет очевидного ответа какую модель открывать первой. Opus 5.5 выглядит самым интересным под тяжёлый кодинг, Sol под ежедневную работу, Astra всё ещё очень сильная на автономных и scientific задачах, а Grok тупо дешёвый и уже совсем не слабый
И держать ради этого четыре отдельные подписки мне вообще не хочется)
Я свои подписки обычно беру через Лачугу, там проще с оплатой, плюс по промокоду HERMES скидка 5%
Следующие дни хочу уже не таблицы смотреть, а погонять Opus 5.5 против Astra на своем SaaS, потому что вот это мне намного интереснее любых бенчмарков
😀Тестим, братки
💎Лачуга промо HERMES -5%
Чат \ Прокси{промо: HERMES -10%} \ OnlyFans
За последние пару дней вышли GPT-6 Sol, Grok 4.7 и Claude Opus 5.5, и я сначала думал что Astra ещё какое-то время спокойно останется самым жирным вариантом под сложный кодинг
Но Opus 5.5 прям удивил
> Terminal-Bench 4.0 - 66.4% против 57.9% у Astra
> FrontierCode - 54.4% против 53.3%
> Humanity’s Last Exam - 67.7% против 57.2%
> GDPval-AA - 1846 против 1542
Причём Anthropic отдельно показывает что на FrontierCode Opus 5.5 даже на среднем thinking обгоняет лучший результат Astra примерно за 1/5 стоимости задачи. Не везде, конечно: в AutomationBench Astra пока впереди 41.4% против 40%, по scientific задачам тоже сильнее
GPT-6 Sol на этом фоне выглядит как более адекватная Astra на каждый день. Контекст те же 1.05M, output до 128k, а API всего $2 / $10. Для обычного вайбкодинга мне сейчас намного логичнее сначала открыть Sol и уже самые тяжёлые задачи кидать в Astra или Opus
Grok 4.7 тоже сильно вырос: CursorBench 46.3% против 40.4% у 4.6, DeepSWE 71%, Terminal-Bench 38% против 20.3%. При этом API оставили $2 / $6, поэтому по цене он вообще выглядит интересно
Короче сейчас у меня впервые нет очевидного ответа какую модель открывать первой. Opus 5.5 выглядит самым интересным под тяжёлый кодинг, Sol под ежедневную работу, Astra всё ещё очень сильная на автономных и scientific задачах, а Grok тупо дешёвый и уже совсем не слабый
И держать ради этого четыре отдельные подписки мне вообще не хочется)
Я свои подписки обычно беру через Лачугу, там проще с оплатой, плюс по промокоду HERMES скидка 5%
Следующие дни хочу уже не таблицы смотреть, а погонять Opus 5.5 против Astra на своем SaaS, потому что вот это мне намного интереснее любых бенчмарков
😀Тестим, братки
💎Лачуга промо HERMES -5%
Чат \ Прокси{промо: HERMES -10%} \ OnlyFans