Qwen выпустили Qwen3.8-27B — и это неожиданно большой скачок относительно Qwen3.6-27B 🚀Это всё ещё
dense-модель на 27B параметров, но прирост особенно заметен не на классических knowledge-бенчмарках, а на реальных coding-, agentic- и multimodal-задачах.
Несколько примеров Qwen3.8-27B → против Qwen3.6-27B:
•
Terminal Bench 2.1: 63.4 →
73.0•
SWE-bench Pro: 53.5 →
61.7•
DeepSWE 1.1: 13.3 →
42.2 — более чем ×3
•
QwenSWEBench: 49.3 →
79.0•
Agents' Last Exam Pass@1: 10.6 →
20.4•
HLE: 24.0 →
30.8•
LiveCodeBench v6: 83.9 →
90.3Но самый интересный скачок, кажется, произошёл в мультимодальных агентах:
•
OSWorld: 63.9 →
84.3•
WebArena: 48.8 →
64.8•
RecreationBench: 29.8 →
47.1•
SWE-MM: 25.7 →
38.6•
Vision2Web: 45.0 →
62.9•
BabyVision: 28.9 →
65.7Причём на некоторых тестах локальная open-weight 27B уже оказывается на уровне или выше гораздо более крупных закрытых моделей из сравнительной таблицы самого Qwen.
По архитектуре всё как и у qwen3.6-27b - это 64 слоя, d_model=5120, гибрид
Gated DeltaNet + Gated Attention, FFN 17,408, multi-step MTP и нативный контекст
262K с возможностью расширения до
1M.
Что особенно интересно: на GPQA прирост всего 87.8 → 89.2, зато на длинных агентских задачах местами +50–200%. Похоже, основной прогресс поколения 3.8 — уже не просто «модель стала немного умнее», а
существенно лучше научилась долго планировать, пользоваться окружением, писать и исправлять код и доводить сложные задачи до конца.
На картинках ниже собрал
все опубликованные Qwen метрики, сравнил с Qwen3.6-27B и, где возможно, с Qwen3.6-35B-A3B, плюс добавил Qwen3.7-Plus, Muse Glimmer-30B и Opus4.6 Max.
Очень мощный релиз для 27B.
Вот мы и определились, на базе чего будем тюнить мультимодалки ^_^
Для скорости пока что всё ещё юзаем Qwen3.6-35B-A3B, а для качественных задач новый фаворит!
🤗 Веса на HF:
bf16 |
fp8 |
ggufНа openrouter пока что нет, но уже появилось в API на
NeuralDeep.ru