TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Tensor Banana

29 Sep, 12:16

Открыть в Telegram Поделиться Пожаловаться

Prev Next
Strata и ninfer - 2 быстрых движка для LLM

Взамен медленной llama.cpp появилось множество быстрых инференс-движков. Расскажу про два, которыми пользуюсь каждый день.

Оба работают под Windows, оба уже скомпилированы.

Железо:
3090 24GB + 64GB DDR4 + SSD, Win11, CUDA 13.

## Strata
- Для Qwen3.8 Flash Next 125B+51B и его файнтюнов, другие модели не поддерживает. Главная фишка - MoE-кэш (самые частые эксперты хранятся в GPU, остальные в RAM или на SSD).
- Нужна особая версия gguf моделек, обычные гуфы не поддерживает. Модельки скачает сама, либо можно взять ссылки из setup.py и самому положить модели в папку Strata-data\models\.
- Железо: NVIDIA 3000 серии и новее (2000-я, вроде, тоже работает, но могут быть нюансы). На 3060 тоже должно запуститься. У меня в 3090 точно влезает 128k контекста с картинками, возможно больше — ещё не тестил.
- Strata поддерживает всего 3 модельки с HF: Qwen3.8 Flash Next, Flash Next Swift 1.5 и OrcaRouter IQ3_XXS.
- Также есть встроенная аблитерация на лету (автор называет её speed projection) для любой модельки.
- Strata обновляется каждый день, недавно завезли поддержку нескольких карт.


## ninfer
- Для Qwen3.8-27B и Qwen3.6-35B и их файнтюнов. Другие не поддерживает. Нужна особая ninfer версия моделек, гуфы не поддерживает.
- Железо: поддерживает только некоторые избранные карты — 3090, 4090, 5060ti, 5090. Для каждой карты надо искать свой форк. Возможно, для других карт тоже появятся билды. У меня влезает до 218k контекста без картинок или 134k с картинками. Скорость падает, но не сильно.


## Скорость на 3090 + 64GB DDR4:

Strata,
Qwen3.8 Flash Next MTP q2_0 (69 GB):
PP ~400 t/s,
TG 45–66 t/s.

ninfer,
Qwen3.8 27B q4 MTP (17 GB):
PP 800 t/s,
TG 50–85 t/s.

Стоковая llama.cpp с MTP:
Qwen 27B — 35 t/s,
Qwen Flash Next 125B — 15 t/s.

## opencode
Также рекомендую попробовать работу с агентами. Есть куча харнессов для этого (UI для общения с агентами). Я юзаю opencode, он есть под Windows, и внутри есть несколько бесплатных облачных моделей. Например, для модели Big Pickle дают 200 бесплатных запросов в день. И есть ещё несколько не очень популярных моделей типа Mimo 2.6 Flash Free. Они работают даже без VPN. Но я гоняю агентов в связке с локальными Qwen 27B (чаще) и Qwen Flash Next (реже). Для гуглинга заюзал Serper API — там дают 2000 бесплатных запросов разово на аккаунт.

Рекомендую попробовать Strata — возможность запускать 125B модельку на обычной видюхе это супер. Надеюсь, кто-нибудь сделает похожий форк для DeepSeek Flash 284B.

Ссылки:

Strata: https://github.com/Niko1221/Strata

ninfer:

https://github.com/Don-Chad/ninfer-3090

https://github.com/sergiuszm/ninfer-4090

https://github.com/ruwwww/ninfer-5060ti

https://github.com/Neroued/ninfer (для 5090)

Агентский харнесс:
https://opencode.ai/

807 1 66 35 55
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot