Репост из: Это крипта, БРАТ!
Вижу инфу про Qwen3.8-27B, что она работает на одной 3090, контекст 262 тысячи, сравнивают с Opus. Забавно такое читать.
Стало интересно че как, т.к. у меня на серваке крутится Qwen3.6-35B-A3B-FP8, MoE.
Вышла эта моделька 14 августа, Apache 2.0, GGUF в тот же день, официальный FP8 сразу. По цифрам Terminal-Bench 63.4 на 73.0, SWE-bench Pro 53.5 на 61.7, DeepSWE 13.3 на 42.2. Поколение сильнее, вопросов нет.
Замерили они сами, независимых замеров не нашел. Строчку "software engineering 49.3 на 79.0", которую все растащили, меряли по их собственному тесту QwenSWEBench. С Opus сравнили выборочно, где обе гоняли на одном стенде, Opus впереди на 5.2 по Terminal-Bench, на 5.3 по NL2Repo, на 2.1 по GPQA. Результат Opus по SWE-bench Pro даже не перезапускали, взяли готовым из карточки Anthropic. И сравнивают с 4.6.
Бенчи мне мало интересны. Интересно, полезет ли она в сервис, где люди юзают одновременно.
Считал на 3090, веса в 4 бит 16 ГБ, зрение почти гигабайт, служебное 2. Свободных остаётся 5 ГБ, и это вся память под истории диалогов. Тысяча токенов истории стоит по расчёту 64 МБ. Значит на всех пользователей вместе у тебя 70-80 тысяч токенов. Дели как хочешь.
Бот-консультант по базе знаний тратит на ответ тысячи четыре. Одновременно карта тянет прикидочно 15-20 диалогов. Сотня юзеров туда влезает спокойно. А вот сотня, нажавшая отправить в одну минуту, встанет в очередь.
Поисковый агент тащит в контекст документы и тратит не четыре тысячи, а тридцать. Одна сессия съедает 2-3 ГБ из 5 доступных. Два человека, и карта кончилась.
И прежде чем сказать первое слово, модель читает весь промпт целиком. Плотная модель на 3090 читает около тысячи токенов в секунду. Документ на тридцать тысяч это полминуты тишины. У меня на 96 Гб карте вход в 215 к токенов проглатывается за 17 секунд.
Еще, в новой модели на каждое слово работают все 27B параметров. Та, что стоит у меня, и та, что у смежников по проекту, обе MoE, параметров 30-35B, а просыпаются на слово 3B активных. Поэтому у смежников на одной 4090 висит модель, кормит их голосового бота и кормила нас, я гонял по ней 8 параллельных запросов, 14 в секунду, без просадки. Окно при этом 20 тысяч, не 256. Вот и весь базар.
Суть не в железе, я мерил свою модель на живой базе. Без инструментов 2 правильных ответа из 42, она уверенно говорила "объекта нет", когда объект есть. С нативными инструментами 42 из 42. Модель одна и та же. Разница в том, ищет она сама по базе или ей навалили текста в промпт и попросили угадать.
Так что если поисковый агент сначала находит нужные куски и отдаёт модели пять тысяч токенов по делу, он поедет и на 3090, и на сотне пользователей. Если архитектура "закинем документ целиком и спросим", не поедет ни на чём, кончится на третьем человеке.
Еще нужно понимать, что режим рассуждений включён по умолчанию и при коротком лимите токенов сжирает его целиком, ответа не будет. Лечится флагом enable_thinking=false. И для запуска нужна vLLM 0.27.2, а она пока nightly.
На 3090 нет FP8, придётся брать четырёхбитную сборку с просадкой в качестве. Официальный FP8 весит 28 ГБ и в 24 не влезает. По-нормальному эта модель живёт от 48 ГБ.
Дальше планирую поднять новую вторым контейнером рядом и прогнать по своим дата-сетам, на которых меряю свои модели.
Стало интересно че как, т.к. у меня на серваке крутится Qwen3.6-35B-A3B-FP8, MoE.
Вышла эта моделька 14 августа, Apache 2.0, GGUF в тот же день, официальный FP8 сразу. По цифрам Terminal-Bench 63.4 на 73.0, SWE-bench Pro 53.5 на 61.7, DeepSWE 13.3 на 42.2. Поколение сильнее, вопросов нет.
Замерили они сами, независимых замеров не нашел. Строчку "software engineering 49.3 на 79.0", которую все растащили, меряли по их собственному тесту QwenSWEBench. С Opus сравнили выборочно, где обе гоняли на одном стенде, Opus впереди на 5.2 по Terminal-Bench, на 5.3 по NL2Repo, на 2.1 по GPQA. Результат Opus по SWE-bench Pro даже не перезапускали, взяли готовым из карточки Anthropic. И сравнивают с 4.6.
Бенчи мне мало интересны. Интересно, полезет ли она в сервис, где люди юзают одновременно.
Считал на 3090, веса в 4 бит 16 ГБ, зрение почти гигабайт, служебное 2. Свободных остаётся 5 ГБ, и это вся память под истории диалогов. Тысяча токенов истории стоит по расчёту 64 МБ. Значит на всех пользователей вместе у тебя 70-80 тысяч токенов. Дели как хочешь.
Бот-консультант по базе знаний тратит на ответ тысячи четыре. Одновременно карта тянет прикидочно 15-20 диалогов. Сотня юзеров туда влезает спокойно. А вот сотня, нажавшая отправить в одну минуту, встанет в очередь.
Поисковый агент тащит в контекст документы и тратит не четыре тысячи, а тридцать. Одна сессия съедает 2-3 ГБ из 5 доступных. Два человека, и карта кончилась.
И прежде чем сказать первое слово, модель читает весь промпт целиком. Плотная модель на 3090 читает около тысячи токенов в секунду. Документ на тридцать тысяч это полминуты тишины. У меня на 96 Гб карте вход в 215 к токенов проглатывается за 17 секунд.
Еще, в новой модели на каждое слово работают все 27B параметров. Та, что стоит у меня, и та, что у смежников по проекту, обе MoE, параметров 30-35B, а просыпаются на слово 3B активных. Поэтому у смежников на одной 4090 висит модель, кормит их голосового бота и кормила нас, я гонял по ней 8 параллельных запросов, 14 в секунду, без просадки. Окно при этом 20 тысяч, не 256. Вот и весь базар.
Суть не в железе, я мерил свою модель на живой базе. Без инструментов 2 правильных ответа из 42, она уверенно говорила "объекта нет", когда объект есть. С нативными инструментами 42 из 42. Модель одна и та же. Разница в том, ищет она сама по базе или ей навалили текста в промпт и попросили угадать.
Так что если поисковый агент сначала находит нужные куски и отдаёт модели пять тысяч токенов по делу, он поедет и на 3090, и на сотне пользователей. Если архитектура "закинем документ целиком и спросим", не поедет ни на чём, кончится на третьем человеке.
Еще нужно понимать, что режим рассуждений включён по умолчанию и при коротком лимите токенов сжирает его целиком, ответа не будет. Лечится флагом enable_thinking=false. И для запуска нужна vLLM 0.27.2, а она пока nightly.
На 3090 нет FP8, придётся брать четырёхбитную сборку с просадкой в качестве. Официальный FP8 весит 28 ГБ и в 24 не влезает. По-нормальному эта модель живёт от 48 ГБ.
Дальше планирую поднять новую вторым контейнером рядом и прогнать по своим дата-сетам, на которых меряю свои модели.