E
Evgenyi
Репост из: Ilyas Salikhov
Можно ли заменить gpt-5.4-mini открытой моделью. Бенч-тест на агенте Exoskeleton
После истории с Fable снова все начали думать об альтернативах, которые не обрубят «с той стороны». С подачи Рината я тут упоролся и провел большое исследование: взял Exoskeleton-агента и прогнал его на 10 открытых семействах моделей без какого-либо изменения кода.
В посте самое ключевое, а в конце найдёте ссылки на полную версию.
Методика
• 10 моделей: GPT (эталон), Kimi, GLM, MiniMax, Nemotron, Mistral, Qwen, Gemma, DeepSeek, Llama
• 3 прогона на каждую, 100 задач в прогоне
• Замеряем качество (score), платформенное время и реальную стоимость прогона (не цена токена, а во сколько обошелся прогон)
Ключевой вывод
Открытые модели не смогли перебить качество gpt, но достойные альтернативы есть. Экзоскелет затачивали под слабые места gpt-5.4-mini. У каждой открытой модели свой профиль слабостей, и обвязка их пока не покрывает. Поэтому замена модели должна идти в паре с доработкой экзоскелета. Хорошая новость в том, что обвязку можно доработать и вытянуть качество агента на уровень gpt.
Кого брать (score / цена прогона):
• Качество — Kimi K2.7: 0.898 / $2.78
• Качество на доллар — MiniMax M3: 0.837 / $1.19 (почти как gpt!)
• Скорость — Mistral Large 3: 58 мин / 0.767 / $1.85
• Средний эшелон — Nemotron, Qwen (0.72–0.76)
• Пока не готовы — Gemma, DeepSeek, Llama (0.55–0.70)
——
• Эталон gpt-5.4-mini/nano: 0.93 / $1.18
MiniMax для меня стал открытием, многообещающая моделька, надо будет изучить подробнее её. Kimi в целом тоже не подкачал. А у DeepSeek, думал, результаты будут лучше.
За высокий score у большинства моделей приходится платить временем
Открытые модели с высоким score проходят прогон в 2–3 раза дольше эталона. А те модели, что быстрее, заметно ниже в качестве.
Низкая цена за токены ≠ дешёвый прогон
Неочевидный инсайт в стоимости прогона. Всё решает наличие cache-тарифа. Агент перечитывает почти один и тот же контекст на каждом шаге, поэтому 90%+ входа кэшируется. Там, где есть дешёвый кэш (Kimi, MiniMax, Mistral), прогон выходит $1.2–2.8. Там где нет (GLM, Qwen, Nemotron) — каждый повторный токен по полной цене. GLM при самом высоком прайсе и без кэш-скидки сжигает ~$11 за прогон — в 9 раз дороже gpt при том же объёме токенов. А MiniMax за счёт кэша укладывается почти в цену нативного gpt. При расчете экономики вашего агента важно считать по формуле «цена за токен × объём × есть ли кэш-скидка».
Отдельный риск в провайдерах
Для открытой модели важно не только качество/цена/время, но и насколько стабильно она работает у провайдера. GLM 5.2 через OpenRouter не поднялась вообще, пришлось откатываться на 5.1. Qwen терял 10–14% задач в каждом прогоне на ошибках провайдера. Gemma завелась только с третьего хостинга, и то 24 задачи из 100 умерли на сериализации. Так что выбор провайдера не менее важен.
Полное исследование:
• [en] OPEN_MODELS_RESEARCH.md
• [ru] OPEN_MODELS_RESEARCH_RU.md
🔗 Инженерия и AI | Ilyas Salikhov
После истории с Fable снова все начали думать об альтернативах, которые не обрубят «с той стороны». С подачи Рината я тут упоролся и провел большое исследование: взял Exoskeleton-агента и прогнал его на 10 открытых семействах моделей без какого-либо изменения кода.
В посте самое ключевое, а в конце найдёте ссылки на полную версию.
Методика
• 10 моделей: GPT (эталон), Kimi, GLM, MiniMax, Nemotron, Mistral, Qwen, Gemma, DeepSeek, Llama
• 3 прогона на каждую, 100 задач в прогоне
• Замеряем качество (score), платформенное время и реальную стоимость прогона (не цена токена, а во сколько обошелся прогон)
Ключевой вывод
Открытые модели не смогли перебить качество gpt, но достойные альтернативы есть. Экзоскелет затачивали под слабые места gpt-5.4-mini. У каждой открытой модели свой профиль слабостей, и обвязка их пока не покрывает. Поэтому замена модели должна идти в паре с доработкой экзоскелета. Хорошая новость в том, что обвязку можно доработать и вытянуть качество агента на уровень gpt.
Кого брать (score / цена прогона):
• Качество — Kimi K2.7: 0.898 / $2.78
• Качество на доллар — MiniMax M3: 0.837 / $1.19 (почти как gpt!)
• Скорость — Mistral Large 3: 58 мин / 0.767 / $1.85
• Средний эшелон — Nemotron, Qwen (0.72–0.76)
• Пока не готовы — Gemma, DeepSeek, Llama (0.55–0.70)
——
• Эталон gpt-5.4-mini/nano: 0.93 / $1.18
MiniMax для меня стал открытием, многообещающая моделька, надо будет изучить подробнее её. Kimi в целом тоже не подкачал. А у DeepSeek, думал, результаты будут лучше.
За высокий score у большинства моделей приходится платить временем
Открытые модели с высоким score проходят прогон в 2–3 раза дольше эталона. А те модели, что быстрее, заметно ниже в качестве.
Низкая цена за токены ≠ дешёвый прогон
Неочевидный инсайт в стоимости прогона. Всё решает наличие cache-тарифа. Агент перечитывает почти один и тот же контекст на каждом шаге, поэтому 90%+ входа кэшируется. Там, где есть дешёвый кэш (Kimi, MiniMax, Mistral), прогон выходит $1.2–2.8. Там где нет (GLM, Qwen, Nemotron) — каждый повторный токен по полной цене. GLM при самом высоком прайсе и без кэш-скидки сжигает ~$11 за прогон — в 9 раз дороже gpt при том же объёме токенов. А MiniMax за счёт кэша укладывается почти в цену нативного gpt. При расчете экономики вашего агента важно считать по формуле «цена за токен × объём × есть ли кэш-скидка».
Отдельный риск в провайдерах
Для открытой модели важно не только качество/цена/время, но и насколько стабильно она работает у провайдера. GLM 5.2 через OpenRouter не поднялась вообще, пришлось откатываться на 5.1. Qwen терял 10–14% задач в каждом прогоне на ошибках провайдера. Gemma завелась только с третьего хостинга, и то 24 задачи из 100 умерли на сериализации. Так что выбор провайдера не менее важен.
Полное исследование:
• [en] OPEN_MODELS_RESEARCH.md
• [ru] OPEN_MODELS_RESEARCH_RU.md
🔗 Инженерия и AI | Ilyas Salikhov