Привет, друзья! Расскажу тут, чем развлекался на прошлой неделе. Давно хотел разобраться, чем реально отличаются модели - не бенчмарки и скриншоты с процентиками (они ничего мне не говорят), а вот чтобы на кончиках пальцев.
Вопрос не праздный - есть ведь открытые модели, которые можно запускать локально, если комп достаточно мощный - как понять, в чем их минус?
Я составил список “потенциальных предпринимательских задач”:
⁃ провести маркетинговое исследование
⁃ сделать лендинг по гайдам
⁃ написать сео-статью (и в целом - собрать скилл по написанию сео-статей)
⁃ поднять телеграм-ботика для приема заявок
⁃ и собрать дашборд со статистикой посещений и заявками
На мой вкус задачи вполне укладываются в предпринимательскую базу - я вот тем, кого завлекаю в ИИ-блуд, рекомендую начинать с таких. Ну и дальше - придумал вымышленый продукт - saas для записи учета в автосервисах и станциях ТО. Собрал папку - все как у больших - бриф, факты, цифры, кейсы, правила бренда и т д. И еще придумал методологию оценки - за что даются или вычитаются баллы (ну и в целом - оценка слепая, в момент начисления баллов неизвестно, какая нейронка выполняла задание).
Продукт может и выдуманный - но рынок настоящий, и в задании указано, что нужен анализ конкурентов, где у каждой цифры должен быть подтвержден источник (ссылка) - и один из критериев - число галлюцинаций и ошибок - то, в чем чаще всего обвиняют нейронки. Мало того, случайно (но так оказалось даже лучше) я забыл положить в задание токен вордстата - в итоге каждая модель сама изобретала, как добыть информацию
Запустил это все на следующих железяках: Opus 5, Gpt 5.6 terra, Grok 4.5, Kimi К3, Deepseek 4 pro, Qwen 3.6, Mimo 2,5 Pro - результаты работ нейронок, а также обший счет можно посмотреть тут:
https://gaika-bench.wibe.manaraga.ai. Прогнал только 3 первых задания (из 5) - ждать дальше не было времени, да и жаба начала душить :))
А итоги такие:
1. Я в целом ожидал победы Опуса - он очень хорош. Не ожидал, что на такую задачу он сожрет столько денег (я специально пробовал не на подписке, а на API - чтобы реальную цену всех моделей сравнить)
2. Я не ожидал, что Kimi (который вроде как дистиллят опуса) будет настолько близок к Опусу по баллам - и при этом в 4 раза дешевле
3. Не ожидал, что GPT (я намеренно использовал Terra, а не Sol - так же как Opus, а не Fable) - так сильно отстанет
4. Приятно удивил Грок - приемлемое качество по цене в 10 раз ниже Опуса. Причем я еще пару недель назад начал активно использовать грок - сначала просто побаловаться, а потом - и в целом в работе. Подписки 30 долларов много на что хватает
5. А еще интересный результат показала модель от Xiomi - Mimo 2.5 Pro. Баллов немного, но цена! в 200 раз дешевле опуса. И эту модель можно запустить на достаточно мощном макбуке вообще без интернета.
6. Самое интересное - кривую верстку видно сразу, за секунду. А выдуманное число (особенно со ссылкой на источник) - выглядит нормально и вполне может уехать в презентацию.
Собственно, там по ссылке есть исходники - если решите гонять у себя и получите другой результат - не кидайтесь ссаными тряпками, вероятно, один прогон недостаточно показателен.
P.S. А если вы не поняли, о чем я - приходите к нам на
курс 🙂 на днях проанонсирую следующий поток
P.P.S. А ссылка - это наш прототип аналога vercel для РФ - c возможностью быстро делиться результатами трудов в нейронках. Детали - тут:
https://wibe.manaraga.ai/ (пока еще сыровато, но будет прямо круто) - про это тоже отдельно расскажу