TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
WingsNodeTeam ®

15 Aug, 12:20

Открыть в Telegram Поделиться Пожаловаться

Репост из: Это крипта, БРАТ!
Вижу инфу про Qwen3.8-27B, что она работает на одной 3090, контекст 262 тысячи, сравнивают с Opus. Забавно такое читать.
Стало интересно че как, т.к. у меня на серваке крутится Qwen3.6-35B-A3B-FP8, MoE.

Вышла эта моделька 14 августа, Apache 2.0, GGUF в тот же день, официальный FP8 сразу. По цифрам Terminal-Bench 63.4 на 73.0, SWE-bench Pro 53.5 на 61.7, DeepSWE 13.3 на 42.2. Поколение сильнее, вопросов нет.

Замерили они сами, независимых замеров не нашел. Строчку "software engineering 49.3 на 79.0", которую все растащили, меряли по их собственному тесту QwenSWEBench. С Opus сравнили выборочно, где обе гоняли на одном стенде, Opus впереди на 5.2 по Terminal-Bench, на 5.3 по NL2Repo, на 2.1 по GPQA. Результат Opus по SWE-bench Pro даже не перезапускали, взяли готовым из карточки Anthropic. И сравнивают с 4.6.

Бенчи мне мало интересны. Интересно, полезет ли она в сервис, где люди юзают одновременно.

Считал на 3090, веса в 4 бит 16 ГБ, зрение почти гигабайт, служебное 2. Свободных остаётся 5 ГБ, и это вся память под истории диалогов. Тысяча токенов истории стоит по расчёту 64 МБ. Значит на всех пользователей вместе у тебя 70-80 тысяч токенов. Дели как хочешь.

Бот-консультант по базе знаний тратит на ответ тысячи четыре. Одновременно карта тянет прикидочно 15-20 диалогов. Сотня юзеров туда влезает спокойно. А вот сотня, нажавшая отправить в одну минуту, встанет в очередь.
Поисковый агент тащит в контекст документы и тратит не четыре тысячи, а тридцать. Одна сессия съедает 2-3 ГБ из 5 доступных. Два человека, и карта кончилась.
И прежде чем сказать первое слово, модель читает весь промпт целиком. Плотная модель на 3090 читает около тысячи токенов в секунду. Документ на тридцать тысяч это полминуты тишины. У меня на 96 Гб карте вход в 215 к токенов проглатывается за 17 секунд.

Еще, в новой модели на каждое слово работают все 27B параметров. Та, что стоит у меня, и та, что у смежников по проекту, обе MoE, параметров 30-35B, а просыпаются на слово 3B активных. Поэтому у смежников на одной 4090 висит модель, кормит их голосового бота и кормила нас, я гонял по ней 8 параллельных запросов, 14 в секунду, без просадки. Окно при этом 20 тысяч, не 256. Вот и весь базар.
Суть не в железе, я мерил свою модель на живой базе. Без инструментов 2 правильных ответа из 42, она уверенно говорила "объекта нет", когда объект есть. С нативными инструментами 42 из 42. Модель одна и та же. Разница в том, ищет она сама по базе или ей навалили текста в промпт и попросили угадать.
Так что если поисковый агент сначала находит нужные куски и отдаёт модели пять тысяч токенов по делу, он поедет и на 3090, и на сотне пользователей. Если архитектура "закинем документ целиком и спросим", не поедет ни на чём, кончится на третьем человеке.
Еще нужно понимать, что режим рассуждений включён по умолчанию и при коротком лимите токенов сжирает его целиком, ответа не будет. Лечится флагом enable_thinking=false. И для запуска нужна vLLM 0.27.2, а она пока nightly.

На 3090 нет FP8, придётся брать четырёхбитную сборку с просадкой в качестве. Официальный FP8 весит 28 ГБ и в 24 не влезает. По-нормальному эта модель живёт от 48 ГБ.

Дальше планирую поднять новую вторым контейнером рядом и прогнать по своим дата-сетам, на которых меряю свои модели.

198 0 1 6
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot