Кому интересны реальные тесты по Grok 4.6 и feedback:
Советую посмотреть видео от Theo (кратко на скрине).
основные тезисы:
От себя:
DeepSeek:
Как уже и говорил, сам пользуюсь DeepSeek, и качество его крайне нравится. Китайцы, работайте 🤝
Советую посмотреть видео от Theo (кратко на скрине).
основные тезисы:
— Grok 4.6 - не новая модель, а пост-трейн поверх 4.5: xAI купил Cursor и забрал их RL-кухню
— По интеллекту догнал фронтир (вровень с Sol 5.6), но токен-эффективность упала на 30%+ → цена за задачу выросла вдвое, скорость просела. Просел ровно там, за что 4.5 и брали - дёшево и быстро
— Дизайн/UI - уровень прошлого поколения, Fable и Sol заметно лучше
— 3D-тест провалил полностью: чёрный экран, после фикса по скрину - инвертированное управление. Открытые китайские веса тут сильнее
— Зато длинные агентные задачи тянет: аудит кодбейса, PR на 1000 строк, потом stacked PR поверх - контекст не терял.
Вывод Theo: сам пользоваться не будет, но ждёт 4.7 через 3–4 недели
От себя:
Я тестил Grok 4.5 — мне не зашёл, максимум для поиска информации по Twitter, но не как постоянная модель.
Пока что у меня вывод такой же: зачем нужен Grok 4.6, когда есть Sol 5.6 или Fable 5/Opus 5?
Тут я писал про Opus 5, что не пользуюсь особо. Попользовался чуть — всё равно Fable 5 сильнее, и это чувствуется.
Но если у вас Claude как основная модель для вайбкодинга или ещё чего-то, то, конечно, Opus 5 good.
Лично у меня Fable 5 — для креатива/брейншторма, за код отвечает Sol 5.6.
Иногда могу Opus 5 поставить на ревью Sol 5.6, но в основном там нет каких-то больших косяков.
DeepSeek:
— Вышла DeepSeek-V4-Pro (почитать подробнее тут)
— Поднимает цены в 3 раза, но при этом остаётся всё ещё дешёвым
Даже после повышения DeepSeek остаётся с большим отрывом самым дешёвым среди конкурентов за своё качество (прочитать подробнее тут).
— Вдобавок DeepSeek выпустила свою обвязку - DeepSeek Harness
Как уже и говорил, сам пользуюсь DeepSeek, и качество его крайне нравится. Китайцы, работайте 🤝