Новые Grok и DeepSeek в один день – ух круто!
Вот что подумалось: на фоне многочисленных историй с побегами ИИ-агентов OpenAI и Anthropic, обе компании оказались в уязвимом положении. Все взгляды направлены на них, поэтому новые модели приходится придерживать – это уже произошло с Astra и может случиться с обновленной Fable/Mythos.
На этом фоне SpaceXAI Илона Маска запустила настоящий конвейер: Grok 4.5 выпустили 8 июля, а уже 12 августа представили Grok 4.6. В основе лежит все та же базовая модель на 1.5T параметров, но вот процесс пост-тренировки в SpaceXAI пересмотрели и расширили.
Начиная с Grok 4.5, при обучении используются данные Cursor – ИИ-стартапа для кодинга, у которого один из лучших корпусов знаний в программировании. А версию 4.6 дополнительно дообучили на задачах SpaceXAI по оптимизации ИИ.
Бенчмарки это подтверждают. В независимом рейтинге Artificial Analysis Grok 4.6 получает 61 очко и делит третье место с GPT-5.6 Sol – впереди только Claude Fable 5 (62) и Claude Opus 5 (63). В API Grok 4.6 стоит $2/$6 – на 60% дешевле Claude Opus 5 и GPT-5.6 Sol.
По нескольким бенчам пройдусь отдельно. В агентно-офисных задачах Grok 4.6 второй после Claude Opus 5: на GDPval-AA (это рейтинг на реальных рабочих задачах) у него 1753 очка против 1741 у Fable 5 и 1728 у Sol, а на юридическом бенчмарке Harvey LAB он и вовсе первый – 15,8%, тогда как GPT-5.6 Sol выдает всего 2,5%.
Отдельно понравилась экономика: на длинных задачах AA-Briefcase модель тратит вдвое меньше ходов и вчетверо меньше токенов, чем Opus 5. То есть Grok дешевле не только по прайсу, он еще и работает экономнее.
Есть и слабые места: сложный кодинг (DeepSWE, FrontierCode) новинка отдает Sol и Fable 5, а на обновленном Terminal-Bench v3.0 (программирование в терминале) у нее провальные ровальные 26% – при том, что предыдущую версию того же теста он проходит вторым в мире (88,4%). Наглядная иллюстрация, как модели подстраиваются под знакомые бенчмарки – и что происходит, когда тест обновляют.
Илон Маск уже анонсит Grok 4.7 – размер модели увеличат до 2,1T, а в обучающий корпус в том числе добавят данные из архивов SpaceX, что должно улучшить результаты в инженерных задачах. Маск обещает запуск в конце августа – моя ставка на первую декаду сентября, что укладывается в новый месячный график релизов компании.
Теперь к DeepSeek. Компания выпустила финальную версию V4 Pro (ранняя была доступна с апреля), повторив трюк Grok 4.6 в китайской лиге: за год модель отстала от Kimi и GLM, но финальная версия зазор почти закрывает. Artificial Analysis пока не добавляли модель в свой сводный рейтинг, но я проанализировал ее бенчмарки с помощью Fable 5 – получается, что по усредненному рейтингу DeepSeek 4 Pro чуть-чуть отстает от Kimi K3, самой мощной китайской модели на сегодня.
Еще интересный момент – как DeepSeek вырос сам над собой с апреля База модели за четыре месяца не изменилась ни на один параметр – все те же 1,6T (из них активных всего 49B) – однако на DeepSWE, бенчмарке сложных инженерных задач, результат вырос с 12,8% до 62,7%, то есть в пять раз. На DSBench-Hard – с 31,1 до 67,2, и так почти по всем строчкам таблицы. Вся эта прибавка – чистая пост-тренировка поверх замороженной базы.
Ценник у DeepSeek 4 Pro – $0,435/$0,87 за миллион входных/выходных токенов. Это в 5-7 раз дешевле Grok 4.6, но сразу накину ложку дегтя – в описании API DeepSeek недавно появилось предупреждение о “скором значительном повышении цен”. Пока без подробностей, надеюсь, что здравый смысл возобладает.
Так что если вам поднадоела конкуренция Anthropic и OpenAI между собой, то есть шанс на интересную осень. Особенно впечатляюще выглядит конвейер SpaceXAI: новая модель каждый месяц – такого мы еще не видели.
—
Красивые цифры в бенчмарках лишь половина успеха – важно уметь пользоваться моделями. Именно этому я учу на “Бусти”, где делюсь своими знаниями и анализирую опыт профессионалов. Вот пара свежих текстов:
👉Как стать лучше в ИИ за вечер с помощью “лестницы” создателя Claude Code
👉Как правильно писать пользовательский промпт и управлять памятью ИИ
Вот что подумалось: на фоне многочисленных историй с побегами ИИ-агентов OpenAI и Anthropic, обе компании оказались в уязвимом положении. Все взгляды направлены на них, поэтому новые модели приходится придерживать – это уже произошло с Astra и может случиться с обновленной Fable/Mythos.
На этом фоне SpaceXAI Илона Маска запустила настоящий конвейер: Grok 4.5 выпустили 8 июля, а уже 12 августа представили Grok 4.6. В основе лежит все та же базовая модель на 1.5T параметров, но вот процесс пост-тренировки в SpaceXAI пересмотрели и расширили.
Начиная с Grok 4.5, при обучении используются данные Cursor – ИИ-стартапа для кодинга, у которого один из лучших корпусов знаний в программировании. А версию 4.6 дополнительно дообучили на задачах SpaceXAI по оптимизации ИИ.
Бенчмарки это подтверждают. В независимом рейтинге Artificial Analysis Grok 4.6 получает 61 очко и делит третье место с GPT-5.6 Sol – впереди только Claude Fable 5 (62) и Claude Opus 5 (63). В API Grok 4.6 стоит $2/$6 – на 60% дешевле Claude Opus 5 и GPT-5.6 Sol.
По нескольким бенчам пройдусь отдельно. В агентно-офисных задачах Grok 4.6 второй после Claude Opus 5: на GDPval-AA (это рейтинг на реальных рабочих задачах) у него 1753 очка против 1741 у Fable 5 и 1728 у Sol, а на юридическом бенчмарке Harvey LAB он и вовсе первый – 15,8%, тогда как GPT-5.6 Sol выдает всего 2,5%.
Отдельно понравилась экономика: на длинных задачах AA-Briefcase модель тратит вдвое меньше ходов и вчетверо меньше токенов, чем Opus 5. То есть Grok дешевле не только по прайсу, он еще и работает экономнее.
Есть и слабые места: сложный кодинг (DeepSWE, FrontierCode) новинка отдает Sol и Fable 5, а на обновленном Terminal-Bench v3.0 (программирование в терминале) у нее провальные ровальные 26% – при том, что предыдущую версию того же теста он проходит вторым в мире (88,4%). Наглядная иллюстрация, как модели подстраиваются под знакомые бенчмарки – и что происходит, когда тест обновляют.
Илон Маск уже анонсит Grok 4.7 – размер модели увеличат до 2,1T, а в обучающий корпус в том числе добавят данные из архивов SpaceX, что должно улучшить результаты в инженерных задачах. Маск обещает запуск в конце августа – моя ставка на первую декаду сентября, что укладывается в новый месячный график релизов компании.
Теперь к DeepSeek. Компания выпустила финальную версию V4 Pro (ранняя была доступна с апреля), повторив трюк Grok 4.6 в китайской лиге: за год модель отстала от Kimi и GLM, но финальная версия зазор почти закрывает. Artificial Analysis пока не добавляли модель в свой сводный рейтинг, но я проанализировал ее бенчмарки с помощью Fable 5 – получается, что по усредненному рейтингу DeepSeek 4 Pro чуть-чуть отстает от Kimi K3, самой мощной китайской модели на сегодня.
Еще интересный момент – как DeepSeek вырос сам над собой с апреля База модели за четыре месяца не изменилась ни на один параметр – все те же 1,6T (из них активных всего 49B) – однако на DeepSWE, бенчмарке сложных инженерных задач, результат вырос с 12,8% до 62,7%, то есть в пять раз. На DSBench-Hard – с 31,1 до 67,2, и так почти по всем строчкам таблицы. Вся эта прибавка – чистая пост-тренировка поверх замороженной базы.
Ценник у DeepSeek 4 Pro – $0,435/$0,87 за миллион входных/выходных токенов. Это в 5-7 раз дешевле Grok 4.6, но сразу накину ложку дегтя – в описании API DeepSeek недавно появилось предупреждение о “скором значительном повышении цен”. Пока без подробностей, надеюсь, что здравый смысл возобладает.
Так что если вам поднадоела конкуренция Anthropic и OpenAI между собой, то есть шанс на интересную осень. Особенно впечатляюще выглядит конвейер SpaceXAI: новая модель каждый месяц – такого мы еще не видели.
—
Красивые цифры в бенчмарках лишь половина успеха – важно уметь пользоваться моделями. Именно этому я учу на “Бусти”, где делюсь своими знаниями и анализирую опыт профессионалов. Вот пара свежих текстов:
👉Как стать лучше в ИИ за вечер с помощью “лестницы” создателя Claude Code
👉Как правильно писать пользовательский промпт и управлять памятью ИИ