Strata и ninfer - 2 быстрых движка для LLM
Взамен медленной llama.cpp появилось множество быстрых инференс-движков. Расскажу про два, которыми пользуюсь каждый день.
Оба работают под Windows, оба уже скомпилированы.
Железо:
3090 24GB + 64GB DDR4 + SSD, Win11, CUDA 13.
## Strata
- Для Qwen3.8 Flash Next 125B+51B и его файнтюнов, другие модели не поддерживает. Главная фишка - MoE-кэш (самые частые эксперты хранятся в GPU, остальные в RAM или на SSD).
- Нужна особая версия gguf моделек, обычные гуфы не поддерживает. Модельки скачает сама, либо можно взять ссылки из setup.py и самому положить модели в папку Strata-data\models\.
- Железо: NVIDIA 3000 серии и новее (2000-я, вроде, тоже работает, но могут быть нюансы). На 3060 тоже должно запуститься. У меня в 3090 точно влезает 128k контекста с картинками, возможно больше — ещё не тестил.
- Strata поддерживает всего 3 модельки с HF: Qwen3.8 Flash Next, Flash Next Swift 1.5 и OrcaRouter IQ3_XXS.
- Также есть встроенная аблитерация на лету (автор называет её speed projection) для любой модельки.
- Strata обновляется каждый день, недавно завезли поддержку нескольких карт.
## ninfer
- Для Qwen3.8-27B и Qwen3.6-35B и их файнтюнов. Другие не поддерживает. Нужна особая ninfer версия моделек, гуфы не поддерживает.
- Железо: поддерживает только некоторые избранные карты — 3090, 4090, 5060ti, 5090. Для каждой карты надо искать свой форк. Возможно, для других карт тоже появятся билды. У меня влезает до 218k контекста без картинок или 134k с картинками. Скорость падает, но не сильно.
## Скорость на 3090 + 64GB DDR4:
Strata,
Qwen3.8 Flash Next MTP q2_0 (69 GB):
PP ~400 t/s,
TG 45–66 t/s.
ninfer,
Qwen3.8 27B q4 MTP (17 GB):
PP 800 t/s,
TG 50–85 t/s.
Стоковая llama.cpp с MTP:
Qwen 27B — 35 t/s,
Qwen Flash Next 125B — 15 t/s.
## opencode
Также рекомендую попробовать работу с агентами. Есть куча харнессов для этого (UI для общения с агентами). Я юзаю opencode, он есть под Windows, и внутри есть несколько бесплатных облачных моделей. Например, для модели Big Pickle дают 200 бесплатных запросов в день. И есть ещё несколько не очень популярных моделей типа Mimo 2.6 Flash Free. Они работают даже без VPN. Но я гоняю агентов в связке с локальными Qwen 27B (чаще) и Qwen Flash Next (реже). Для гуглинга заюзал Serper API — там дают 2000 бесплатных запросов разово на аккаунт.
Рекомендую попробовать Strata — возможность запускать 125B модельку на обычной видюхе это супер. Надеюсь, кто-нибудь сделает похожий форк для DeepSeek Flash 284B.
Ссылки:
Strata: https://github.com/Niko1221/Strata
ninfer:
https://github.com/Don-Chad/ninfer-3090
https://github.com/sergiuszm/ninfer-4090
https://github.com/ruwwww/ninfer-5060ti
https://github.com/Neroued/ninfer (для 5090)
Агентский харнесс:
https://opencode.ai/
Взамен медленной llama.cpp появилось множество быстрых инференс-движков. Расскажу про два, которыми пользуюсь каждый день.
Оба работают под Windows, оба уже скомпилированы.
Железо:
3090 24GB + 64GB DDR4 + SSD, Win11, CUDA 13.
## Strata
- Для Qwen3.8 Flash Next 125B+51B и его файнтюнов, другие модели не поддерживает. Главная фишка - MoE-кэш (самые частые эксперты хранятся в GPU, остальные в RAM или на SSD).
- Нужна особая версия gguf моделек, обычные гуфы не поддерживает. Модельки скачает сама, либо можно взять ссылки из setup.py и самому положить модели в папку Strata-data\models\.
- Железо: NVIDIA 3000 серии и новее (2000-я, вроде, тоже работает, но могут быть нюансы). На 3060 тоже должно запуститься. У меня в 3090 точно влезает 128k контекста с картинками, возможно больше — ещё не тестил.
- Strata поддерживает всего 3 модельки с HF: Qwen3.8 Flash Next, Flash Next Swift 1.5 и OrcaRouter IQ3_XXS.
- Также есть встроенная аблитерация на лету (автор называет её speed projection) для любой модельки.
- Strata обновляется каждый день, недавно завезли поддержку нескольких карт.
## ninfer
- Для Qwen3.8-27B и Qwen3.6-35B и их файнтюнов. Другие не поддерживает. Нужна особая ninfer версия моделек, гуфы не поддерживает.
- Железо: поддерживает только некоторые избранные карты — 3090, 4090, 5060ti, 5090. Для каждой карты надо искать свой форк. Возможно, для других карт тоже появятся билды. У меня влезает до 218k контекста без картинок или 134k с картинками. Скорость падает, но не сильно.
## Скорость на 3090 + 64GB DDR4:
Strata,
Qwen3.8 Flash Next MTP q2_0 (69 GB):
PP ~400 t/s,
TG 45–66 t/s.
ninfer,
Qwen3.8 27B q4 MTP (17 GB):
PP 800 t/s,
TG 50–85 t/s.
Стоковая llama.cpp с MTP:
Qwen 27B — 35 t/s,
Qwen Flash Next 125B — 15 t/s.
## opencode
Также рекомендую попробовать работу с агентами. Есть куча харнессов для этого (UI для общения с агентами). Я юзаю opencode, он есть под Windows, и внутри есть несколько бесплатных облачных моделей. Например, для модели Big Pickle дают 200 бесплатных запросов в день. И есть ещё несколько не очень популярных моделей типа Mimo 2.6 Flash Free. Они работают даже без VPN. Но я гоняю агентов в связке с локальными Qwen 27B (чаще) и Qwen Flash Next (реже). Для гуглинга заюзал Serper API — там дают 2000 бесплатных запросов разово на аккаунт.
Рекомендую попробовать Strata — возможность запускать 125B модельку на обычной видюхе это супер. Надеюсь, кто-нибудь сделает похожий форк для DeepSeek Flash 284B.
Ссылки:
Strata: https://github.com/Niko1221/Strata
ninfer:
https://github.com/Don-Chad/ninfer-3090
https://github.com/sergiuszm/ninfer-4090
https://github.com/ruwwww/ninfer-5060ti
https://github.com/Neroued/ninfer (для 5090)
Агентский харнесс:
https://opencode.ai/