TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
сбежавшая нейросеть

13 Aug, 07:05

Открыть в Telegram Поделиться Пожаловаться

Новые Grok и DeepSeek в один день – ух круто!

Вот что подумалось: на фоне многочисленных историй с побегами ИИ-агентов OpenAI и Anthropic, обе компании оказались в уязвимом положении. Все взгляды направлены на них, поэтому новые модели приходится придерживать – это уже произошло с Astra и может случиться с обновленной Fable/Mythos.

На этом фоне SpaceXAI Илона Маска запустила настоящий конвейер: Grok 4.5 выпустили 8 июля, а уже 12 августа представили Grok 4.6. В основе лежит все та же базовая модель на 1.5T параметров, но вот процесс пост-тренировки в SpaceXAI пересмотрели и расширили.

Начиная с Grok 4.5, при обучении используются данные Cursor – ИИ-стартапа для кодинга, у которого один из лучших корпусов знаний в программировании. А версию 4.6 дополнительно дообучили на задачах SpaceXAI по оптимизации ИИ.

Бенчмарки это подтверждают. В независимом рейтинге Artificial Analysis Grok 4.6 получает 61 очко и делит третье место с GPT-5.6 Sol – впереди только Claude Fable 5 (62) и Claude Opus 5 (63). В API Grok 4.6 стоит $2/$6 – на 60% дешевле Claude Opus 5 и GPT-5.6 Sol.

По нескольким бенчам пройдусь отдельно. В агентно-офисных задачах Grok 4.6 второй после Claude Opus 5: на GDPval-AA (это рейтинг на реальных рабочих задачах) у него 1753 очка против 1741 у Fable 5 и 1728 у Sol, а на юридическом бенчмарке Harvey LAB он и вовсе первый – 15,8%, тогда как GPT-5.6 Sol выдает всего 2,5%.

Отдельно понравилась экономика: на длинных задачах AA-Briefcase модель тратит вдвое меньше ходов и вчетверо меньше токенов, чем Opus 5. То есть Grok дешевле не только по прайсу, он еще и работает экономнее. 

Есть и слабые места: сложный кодинг (DeepSWE, FrontierCode) новинка отдает Sol и Fable 5, а на обновленном Terminal-Bench v3.0 (программирование в терминале) у нее провальные ровальные 26% – при том, что предыдущую версию того же теста он проходит вторым в мире (88,4%). Наглядная иллюстрация, как модели подстраиваются под знакомые бенчмарки – и что происходит, когда тест обновляют.

Илон Маск уже анонсит Grok 4.7 – размер модели увеличат до 2,1T, а в обучающий корпус в том числе добавят данные из архивов SpaceX, что должно улучшить результаты в инженерных задачах. Маск обещает запуск в конце августа – моя ставка на первую декаду сентября, что укладывается в новый месячный график релизов компании.

Теперь к DeepSeek. Компания выпустила финальную версию V4 Pro (ранняя была доступна с апреля), повторив трюк Grok 4.6 в китайской лиге: за год модель отстала от Kimi и GLM, но финальная версия зазор почти закрывает. Artificial Analysis пока не добавляли модель в свой сводный рейтинг, но я проанализировал ее бенчмарки с помощью Fable 5 – получается, что по усредненному рейтингу DeepSeek 4 Pro чуть-чуть отстает от Kimi K3, самой мощной китайской модели на сегодня.

Еще интересный момент – как DeepSeek вырос сам над собой с апреля База модели за четыре месяца не изменилась ни на один параметр – все те же 1,6T (из них активных всего 49B) – однако на DeepSWE, бенчмарке сложных инженерных задач, результат вырос с 12,8% до 62,7%, то есть в пять раз. На DSBench-Hard – с 31,1 до 67,2, и так почти по всем строчкам таблицы. Вся эта прибавка – чистая пост-тренировка поверх замороженной базы. 

Ценник у DeepSeek 4 Pro – $0,435/$0,87 за миллион входных/выходных токенов. Это в 5-7 раз дешевле Grok 4.6, но сразу накину ложку дегтя – в описании API DeepSeek недавно появилось предупреждение о “скором значительном повышении цен”. Пока без подробностей, надеюсь, что здравый смысл возобладает.

Так что если вам поднадоела конкуренция Anthropic и OpenAI между собой, то есть шанс на интересную осень. Особенно впечатляюще выглядит конвейер SpaceXAI: новая модель каждый месяц – такого мы еще не видели.
—
Красивые цифры в бенчмарках лишь половина успеха – важно уметь пользоваться моделями. Именно этому я учу на “Бусти”, где делюсь своими знаниями и анализирую опыт профессионалов. Вот пара свежих текстов:

👉Как стать лучше в ИИ за вечер с помощью “лестницы” создателя Claude Code
👉Как правильно писать пользовательский промпт и управлять памятью ИИ

7.8k 1 54 65
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot