Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёраГоняю
новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать.
🏆 Агентный бенчмарк: вровень с фронтиромПрогнал PAC1 — набор из 43 агентных задач. Qwen3.8-27B в режиме reasoning xhigh выдал
90,7%. Ровно столько же, сколько Claude Sonnet 5. Больше, чем у DeepSeek V4 Pro на 1,6 триллиона параметров (89,9%).
И это всего лишь 27 миллиардов параметров. Локально. Без интернета.
🐌 А теперь ценаSonnet 5 прошёл бенч за 27,8 минуты. Qwen3.8-27B — за 3,4 часа. Скорость генерации — 10 ток/с. Прикрутил спекулятивный декодинг MTP-3, стало 18 ток/с.
Первая мысль была «криво настроил, надо тюнить дальше». Потом прикинул по формуле — оказалось, виновата шина:
📐 макс. ток/с = пропускная способность памяти / размер активных весов
Каждый токен требует вычитать все активные веса из памяти. Заново. У DGX Spark шина 273 ГБ/с, NVFP4-чекпоинт весит 26,4 ГБ. Делим —
потолок ~10 ток/сек. Ровно то, что я и видел до спекулятивки.
Для контраста: Qwen3.6-35B-A3B на том же железе даёт 75 ток/с. Модель больше, но это MoE — активны 3B из 35B, читается два гигабайта вместо двадцати шести.
👁 Видео: описывает отлично, понимает плохоВторой тест — скормил 28-секундную запись экрана. Сценарий: скроллю до расширения Контур,
включаю его, двигаю анимированного персонажа,
выключаю обратно.
🔸
Без ризонинга (ответ за 28 с) — подробнейшее описание интерфейса: Chrome, страница расширений, список плагинов, мультяшный персонаж, текст тултипа. Действий модель не разобрала вообще. Как будто ей дали скриншот, а не видео.
🔸
С ризонингом (94 с, втрое дольше) — появился пошаговый разбор с выводами о намерениях пользователя. Выглядит убедительно. И неверно.
🤔 Переключение Контура засекла только модель с ризонингом — интересно, почему? Но каждый раз путалась в показаниях: то описывала включение, то отключение. Как будто дробление на кадры происходит случайным образом. Видимо, тумблер размером 40 пикселей — это шум для EVS при нарезке кадров на токены.
Кстати, стоит помнить, что Qwen3-VL сэмплит видео на 2 fps, то есть если будем пытаться делать скиллы по скринкасту, плотность действий на экране должна быть низкой, а темп медленным.
🗺️ Копии интерфейсов по скриншоту — прекрасноТретий тест — сгенерировал в ChatGPT картинку «хиро-блок сайта» и попросил Qwen сверстать её в HTML. Получилось очень близко к оригиналу.
В одном из прогонов референс был с картинками. Модель сама сообразила, откуда их взять, и подставила сервис моковых изображений. Похоже, интерфейсы уже сейчас можно генерировать огромными партиями на небольших локальных моделях.
🧾 Что в итоге, где затестить и сколько стоитЕсли говорить о запуске на локальном мини-ПК вроде DGX Spark, Qwen3.8-27B — отличная модель, но очень медленная. Для задач, где важен результат, а не время отклика — ночные прогоны, батчи, автономные агенты — это лучшее, что сегодня можно поставить локально.
Для интерактива терпения не хватит. Поэтому тут выручают провайдеры:
• У нас в РФ эту модель уже поднял
Валера — ребята затащили скорость 67 ток/сек
• На OpenRouter — 3 доллара за миллион выходных токенов, но Throughput 16 ток/сек настораживает
• Вот бы дождаться раздачи на
cloud.cerebras.ai — там это будет выглядеть сверхбыстрой магией по 500 ток/с.
Интересно, когда мы сможем тянуть такие модели прям на локальном железе? Кто что думает?----
Поляков считает — AI, код и кейсы