TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Refat Talks: Tech & AI

1 Sep, 22:40

Открыть в Telegram Поделиться Пожаловаться

Qwen 3.8 27B, локальный инференс и мои эксперименты с подбором железа

Про эту модель уже несколько недель пишут "Opus 4.6 у себя дома". Нет, конечно. Но, черт, это первая небольшая локальная модель, которую я готов всерьез обсуждать в агентных сценариях, а не для чата по базе знаний.

Небольшие локальные модели (которые влезут в домашний GPU) на агентных задачах часто зацикливается, либо ломают tool-calling. Qwen 3.8 27B, пожалуй первая в моих тестах, у которой это не разваливается. На агентном индексе Artificial Analysis она #8 из 140 моделей, сразу за Kimi K2, которая в сто раз больше по параметрам, и реддите ее дружно хвалят и тд.

Мои тесты этой (и не только) модельки совпали с вполне прикладной задачей - выбрать железо для локального AI-периметра. Надо выбрать одновременно и модель, и железо. Для этого решил арендовать стенды на Vast.ai: 3090 за $0.13/час, там же брал 4090, 5090 и GB10 (тот же DGX Spark). Написал skill поверх их CLI, и дальше вместе с Claude поднимал и тушил машины для экспериментов, гонял бенчмарки по SSH и вел журнал. Десятки замеров, четыре типа железа, ряд моделей - все вместе примерно пару десятков баксов.

Вот на контрасте с соседями по весовой категории (уместиться в 5090 или пару 3090) плотная Qwen 3.8 и выстрелила. Единственная из всех стендов дважды нашла все 10 заложенных дефектов в тестовом договоре. 100 из 100 по tool-calling. На заведомо нерешаемой задаче остановилась за 4 шага и честно отчиталась, пока конкуренты (в том числе MoE) зацикливались. Ну и да - первая локальная модель, которая осилила мой лифтовый вайб-чек (посмотрите пост, в декабре у ChatGPT лифт не ехал!). Минусы тоже есть: например, модель требует высокой полосы (на маке и Spark работает медленно) и, главное - знаний о мире у 27B, заметно меньше. Но знания агенту приносят тулы и поиск, а вот дисциплину в цикле извне не принесешь.

Если присматриваетесь к локальному инференсу под агентов, вот что я бы хотел знать заранее:
1. Считайте секунды на шаг агента, а не только токены в секунду. У меня модель с втрое большим декодом делала шаг за 2.1 секунды против 1.2 у "медленной" и решала задачу за большее кол-во шагов.

2. Часто говорят только про память, но тут есть как минимум три оси. VRAM решает влезет ли модель и останется ли место под кэш. Пропускная способность памяти - очень важный параметр, влияет в первую очередь на скорость генерации ответа (поэтому старенькая 3090 все еще тащит). Compute решает, как быстро модель переваривает входящий промпт. Это упрощенно, вот например неплохой визуальный разбор roofline-модели. Отсюда следует много всего, например что при низкой полосе (на маках, спарках) лучше брать MoE модели.

3. Чат упирается в память, агент - в compute, контекст и кэш. Самое дорогое в агентном цикле - не ответ, а чтение промпта. Шагов много и на каждом шаге агент заново отправляет всю историю. Тут экстремально важен префикс-кэш.

4. Смена движка или его настроек может дать разницу в разы. Вариантов много: vLLM, SGLang, llama.cpp, кастомные движки вроде NInfer. Перебирать это руками долго, поэтому у меня этим занимался агент в стиле авторесерча: поднял ряд стендов, прогнал матрицу экспериментов параллельно, записал в журнал и тд.

5. Комьюнити уже прошло часть пути за вас: есть и готовые рецепты типа 3090-club и тулы вроде llmfit: сканирует железо и подтягивает реальные замеры других пользователей. Только эти бенчмарки регулярно не сходятся с реальностью. Тестируйте на своих задачах.


По итогам, кстати, для этой модели по соотношению цена/качество победила пара 3090. А самое интересное в этой системе - архитектура "советника": локальная модель делает всю работу, а для редких сложных вопросов зовет фронтир через строгий гейт, который не выпускает приватные данные за периметр. Но это уже отдельный пост.

upd: кстати, если хочется уже сейчас протестить, то у Валеры на neuraldeep она доступна бесплатно

🔥 ➕ 🔁 @nobilix

7.4k 8 218 29 129
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot