Короче мой сетап на сегодняшний день таков:
2xGPT PRO MAX ($400)
3xKimi PRO MAX ($600)
4xQwen PRO MAX ($272)
GPT 5.6 Sol Max - самый умный
Kimi K3 Max - сбалансированный
Qwen3.8max - самый талантливый
Но
GPT - самый задушенный в обе стороны:
1) Ему очень много чего нельзя, а все что ему нельзя поверьте сказывается на всём вообще что он делает включая то что ему можно.
2) Каждая следующая ступень ризонинга вверх не просто делает его умнее, а опять же ЗАПРЕЩАЕТ БЫТЬ ГЛУПЕЕ. Отсюда маниакальность и часы/дни там где можно было идеально справиться за минуты. Сотни файлов там где достаточно было кусочка одного, итд.
Причем зацикленность эта из п2 не зашита в модели, а является побочным явлением усугубляющимся в процессе работы. Чем дальше в лес - тем толще эти волки. Поэтому любые ризонинги выше чем Medium надо использовать только чтобы ими думать, но работать ими можно лишь над достаточно узкой/простой задачей, в которой модель просто не успеет сойти с ума и нанести вреда больше чем пользы.
В итоге оказалось что GPT 5.6 Sol MEDIUM - это по-сути тот же GPT 5.5 xhigh только умнее за счет тех свойств что есть у модели независимо от ризонинга. Например у 5.6 глаза гораздо дальше расположены чем у 5.5, и за счет этого она видит те участки задачи которые 5.5 не видит.
Короче я потерял всякий интерес использовать 5.5 когда разобрался в 5.6.
Просто нашего брата поймали за собственную алчность. Ну не может человек из российской глубинки поверить что шилдик на котором написано "почти самая ебаная хуйня для никчемных мразей" это именно то что ему нужно. Такой человек купит любой АБИБАС если на ценнике написано "ЛЮКС"...
Ещё важно что в конфиге настраивается отдельно thinking effort для plan mode, и его-то как раз можно поставить на Max/Ultra.
В итоге я все задачи гоняю через plan mode. 5.6 Sol Max своим маниакальным взглядом выискивает каждую пылинку, и делает план по уровню я думаю местами опережающий возможности GPT 5.5 PRO, тогда как на реализацию этот план уходит 5.6 Sol Medium, который достаточно умен чтобы тупо безошибочно написать весь нужный код и проделать все нужные дела руками.
KIMI
Я довольно быстро понял что Kimi это классная модель, но так же я быстро понял что она в подметки не годится GPT 5.6 в плане интеллекта. Kimi это победитель линейки 5.5 (и то по точности результата в плане числа генерируемых багов или пропущенных напрочь важных зон я бы поспорил), но не 5.6. Даже близко.
Однако KIMI абсолютно непревзойденный дизайнер. Я рисую ей дизайны тупо на
kimi.ai кнопка websites. Мне нравилось рисовать Claude Design, но наверно о чем-то говорит что я ни разу после того как открыл Kimi Design по Claude Design не скучал, и не заходил туда даже не смотря на то что у меня есть подписка и на Anthropic, просто я больше это семейство в ростер не отношу, это чисто nice to have для экспериментов и теста новых вещей которые там будут выходить.
Ещё Kimi полезна для того чтобы закидывать ей длинные сессии Codex (у меня в целом почти любые сессии длятся по 15-30-50 часов) и спрашивать прогресс и альтернативное мнение о происходящем в сессии. Закидывать сессии это просто копируем правой кнопкой ебучей мыши ID сессии в GPT APP и вставляем кими и говорим йоу систа глянь плиз как там развиваются события и расскажи мне что думаешь.
Это полезный моушен, который экономит время, снижает стресс, позволяет думать немножко прозорливее наперед. А иногда дает реальную почву для вторжения в сессию кодекса с каким-нибудь громогласным steer.
Кодить самой Kimi так чтобы она сама принимала решения о том что зачем и как кодить - я практически перестал. Если на GPT становится мало ресурсов - самое время поручить Codex'у перестать кодить своими руками и управлять кодинговыми сессиями Kimi.
Это не идеально, потому что я в какой-то момент накопил достаточно наблюдений чтобы сказать с уверенностью: модели ну очень ебано управляют друг-другом. Однако если на кими дохуя лишних лимитов, то даже если эффективность разработки GPT Sol -> Kimi падает в несколько раз - это терпимее чем выдаивать в ноль Кодекс чтобы потом нахуевертить багов с Kimi, и потом фиксить их Кодексом =)))))) Ебал я такое в рот.
Qwen3.8max - был кстати шикарными руками для Codex, но сплыл, потому что скорость его замедлили примерно в 50 раз, а стоимость токенов подозрительно приблизилась к стоимости токенов по API. Таким образом Qwen стал тупо самым дорогим в природе если использовать его в разработке, by far.
Однако, Qwen3.8max - это самый талантливый литератор, способный писать ЛУЧШЕ БОЛЬШИНСТВА ЛЮДЕЙ. Во всяком случае в руках кого-то кто умеет неплохо писать тоже. А умение так хорошо писать не может существовать само по себе. Он тупо шикарно подготовлен в гуманитарном любом деле, и бесполезным это никак не назовешь.
Это значит что он прекрасный компаньон 5.6 Sol и Kimi для каких-нибудь важных затяжных брейнштормов, судья всего что связано с эмиссией любых слов где-либо какой угодно моделью, формулятор контрактов и принципов для других моделей, итд. Чем дольше я с ним практикуюсь - тем больше и лучше я понимаю как и зачем его использовать в мелочах.
Ещё у Qwen есть в CLI всякие фэнси модели типа GLM и других, которые можно дергать и не завидовать что у кого-то есть кошкожена а у тебя нет.
Mythos сосёт писос.
Ну и конечно не стоит забывать что любая модель - это МАКСИМУМ 50% влияния на результат.
Остальные 50% - это ваш собственный харнесс (
Agents.md и прочая матрешка логических контрактов которые ЛЛМки будут исполнять каждую сессию или когда обращаются к конкретным репам), ваш навык (я многому научился на прошлой неделе, а значит ранее этого не умел, хотя вайбдрочу с прошлого сентября), ваша нервная система, усидчивость, итд итп.
Чем больше я общаюсь с разными людьми тет-а-тет о вайбкодинге, тем больше понимаю что разрыв между мной и ими растёт, поскольку я продолжаю сидеть ВЕСЬ ДЕНЬ, а они садятся даже не каждый день, и не проводят в процессе больше нескольких часов.
Слушая их, я понимаю что бросать советы через плечо - не принесёт им никакой пользы, как когда-то я понял про консалтинг..