Репост из: Hermes Ledger
😆GROK 4.6 аля Маск снова догнал топов
Вчера xAI выкатили Grok 4.6. Основной упор сделали на длинные агентские сессии, код и визуальные проекты. То есть не просто попросил написать функцию и вышел, а дал большую задачу, агент сам походил по проекту, что-то собрал, проверил и продолжил работать дальше.
По бенчмаркам он реально залетел очень высоко:
То есть по обычному агентскому кодингу Grok уже спокойно стоит рядом с Sol и местами его обходит. Но без сказок, что Grok теперь уничтожил вообще всех. На DeepSWE у него 65.9% против 73% у Sol, а на Terminal-Bench 3.0 - 26% против 34.6% у Sol. Opus 5 там вообще забрал 43.5%
Самое интересное для меня - Grok Build уже полностью перевели на 4.6. Там есть сабагенты, скиллы, Plan Mode, MCP и работа с большими проектами. Короче, ещё один полноценный конкурент Codex и Claude Code
По API тоже вполне адекватно: $2 за миллион входящих токенов и $6 за миллион исходящих. Есть Fast версия, она в 2 раза дороже. Плюс первую неделю xAI дают x2 лимиты на Grok 4.6 внутри Cursor и Grok Build
Если хочется пользоваться именно обычным Grok, нужен SuperGrok. Официально он стоит $30 в месяц и туда уже входит Grok 4.6
Я сегодня чекнул Лачугу - у них SuperGrok на месяц сейчас лежит за 3000₽. Для РФ вообще удобно, потому что не нужно думать, как оплатить подписку напрямую
Плюсом промик HERMES даст скидку 5%
Может, сам тоже потом нормально погоняю его на реальном проекте. По табличкам выглядит сильно, но в вайбкодинге намного интереснее уже смотреть, как модель держит большой проект, сколько раз ломает рабочий код и насколько часто приходится объяснять одно и то же второй раз
😀Тестим, братки
😀 ProxyWing промик HERMES -10%
Чат \ Sea Battle \ Лачуга \ OnlyFans
Вчера xAI выкатили Grok 4.6. Основной упор сделали на длинные агентские сессии, код и визуальные проекты. То есть не просто попросил написать функцию и вышел, а дал большую задачу, агент сам походил по проекту, что-то собрал, проверил и продолжил работать дальше.
По бенчмаркам он реально залетел очень высоко:
AA Intelligence(общий индекс умности модели) - 61
GPT-5.6 Sol - тоже 61, Fable 5 - 62
CursorBench 3.2(насколько хорошо модель справляется с реальными задачами разработчика в Cursor) - 69.9%
GPT-5.6 Sol - 67.2%, Fable 5 - 70.5%
GDPVal-AA(сколько хорошо модель решает реальные рабочие задачи из разных профессий) - 1753
GPT-5.6 Sol - 1728, Fable 5 - 1741
FrontierCode(насколько код модели уже похож на нормальный продакшен-код) - 61.3%
GPT-5.6 Sol - 60.6%, Fable 5 - 63.6%
То есть по обычному агентскому кодингу Grok уже спокойно стоит рядом с Sol и местами его обходит. Но без сказок, что Grok теперь уничтожил вообще всех. На DeepSWE у него 65.9% против 73% у Sol, а на Terminal-Bench 3.0 - 26% против 34.6% у Sol. Opus 5 там вообще забрал 43.5%
Самое интересное для меня - Grok Build уже полностью перевели на 4.6. Там есть сабагенты, скиллы, Plan Mode, MCP и работа с большими проектами. Короче, ещё один полноценный конкурент Codex и Claude Code
По API тоже вполне адекватно: $2 за миллион входящих токенов и $6 за миллион исходящих. Есть Fast версия, она в 2 раза дороже. Плюс первую неделю xAI дают x2 лимиты на Grok 4.6 внутри Cursor и Grok Build
Если хочется пользоваться именно обычным Grok, нужен SuperGrok. Официально он стоит $30 в месяц и туда уже входит Grok 4.6
Я сегодня чекнул Лачугу - у них SuperGrok на месяц сейчас лежит за 3000₽. Для РФ вообще удобно, потому что не нужно думать, как оплатить подписку напрямую
Плюсом промик HERMES даст скидку 5%
Может, сам тоже потом нормально погоняю его на реальном проекте. По табличкам выглядит сильно, но в вайбкодинге намного интереснее уже смотреть, как модель держит большой проект, сколько раз ломает рабочий код и насколько часто приходится объяснять одно и то же второй раз
😀Тестим, братки
😀 ProxyWing промик HERMES -10%
Чат \ Sea Battle \ Лачуга \ OnlyFans