Grok 4.6 вышел
Главный фокус – долгоживущие агенты и интерактивная/визуальная работа: модель должна держать задачу на много шагов, а не выдавать один хороший ответ.
– AA Intelligence Index: 61 против 56 у Grok 4.5. Это ровно уровень GPT-5.6 Sol Max (61) и почти Fable 5 Max (62). Скачок за месяц серьёзный. Прикольно, что в табличке в скриншоте не боятся показывать бенчмарки, на которых не занимают 1 места. Сейчас все в тройке, но при этом цена вообще мизерная - $2 / $6 за 1M токенов, есть fast-вариант вдвое дороже. Первую неделю – 2x включённого лимита в Grok Build и Cursor.
– Доступ сразу везде: Cursor, Grok Build, API, OpenRouter, Vercel, Cloudflare.
– Тренировали интересно: Grok 4.5 использовали, чтобы перегенерировать SFT-траектории для 4.6, а мусорные трейсы отфильтровали модельными проверками. Модель учит модель.
В кодинге пока чуть отстает, а вот в работе белых воротничков - лидер: GDPval-AA v2 — 1753 (у Fable 1741, у GPT 1728), AA-Briefcase – 1577, и особенно Harvey LAB на юридических задачах: 15.8% против 11.3% у Fable и 2.5% у GPT-5.6. Разрыв в шесть раз.
Кажется это сейчас лучший вариант для длинных агентов над документами и офисной работой: разбор договоров, заявок, отчётности.
x.ai/news/grok-4-6
Главный фокус – долгоживущие агенты и интерактивная/визуальная работа: модель должна держать задачу на много шагов, а не выдавать один хороший ответ.
– AA Intelligence Index: 61 против 56 у Grok 4.5. Это ровно уровень GPT-5.6 Sol Max (61) и почти Fable 5 Max (62). Скачок за месяц серьёзный. Прикольно, что в табличке в скриншоте не боятся показывать бенчмарки, на которых не занимают 1 места. Сейчас все в тройке, но при этом цена вообще мизерная - $2 / $6 за 1M токенов, есть fast-вариант вдвое дороже. Первую неделю – 2x включённого лимита в Grok Build и Cursor.
– Доступ сразу везде: Cursor, Grok Build, API, OpenRouter, Vercel, Cloudflare.
– Тренировали интересно: Grok 4.5 использовали, чтобы перегенерировать SFT-траектории для 4.6, а мусорные трейсы отфильтровали модельными проверками. Модель учит модель.
В кодинге пока чуть отстает, а вот в работе белых воротничков - лидер: GDPval-AA v2 — 1753 (у Fable 1741, у GPT 1728), AA-Briefcase – 1577, и особенно Harvey LAB на юридических задачах: 15.8% против 11.3% у Fable и 2.5% у GPT-5.6. Разрыв в шесть раз.
Кажется это сейчас лучший вариант для длинных агентов над документами и офисной работой: разбор договоров, заявок, отчётности.
x.ai/news/grok-4-6