TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
MrGips • Про LLM

28 Sep, 13:00

Открыть в Telegram Поделиться Пожаловаться

🚀 Появился новый движок Strata, который запускает огромную Qwen3.8 Flash Next даже на видеокартах с 12 GB VRAM

Думаю вы уже знаете что Qwen3.8 Flash Next большая MoE-модель, которая требует очень много памяти. Но разработчик нового inference-движка Strata смог распределить её между GPU, оперативной памятью и SSD.

В результате модель уже запускают даже на обычных игровых видеокартах.

На RTX 5070 12 GB при контексте 128K разработчик получил:

• Q2_0 - около 65 tok/s
• IQ2_XS - около 52 tok/s
• IQ3_XXS - около 45 tok/s
• IQ3_S - около 42 tok/s

На коротком контексте скорость ещё выше.

Появились и тесты от других пользователей:

• RTX 5070 Ti - около 86 tok/s на IQ3_XXS при 64K
• RTX 4090 - примерно 58–70 tok/s на IQ3_S при 262K
• даже RTX 2070 8 GB удалось запустить примерно на 20 tok/s

Как это работает?

Strata не пытается полностью загрузить огромную модель в видеопамять.

Самые востребованные части модели находятся на GPU, остальные MoE-эксперты - в RAM, а большая PLE/n-gram память может храниться на SSD.

Таким образом, Flash Next можно запускать даже при относительно небольшом объёме VRAM.

Ещё одна важная функция — кеширование диалога. После первого запроса Strata сохраняет состояние и при следующих обращениях обрабатывает только новый контекст, что особенно важно для AI-агентов и программирования.

Пока у проекта есть ограничения: нет полноценного multi-GPU.

Но сам факт уже интересный: Qwen3.8 Flash Next постепенно превращается из огромной модели для дорогих серверов в LLM, которую можно запускать на обычном домашнем ПК.

Я сам еще не пробовал, но в НАШЕМ ЧАТЕ люди потихоньку запускают, скорость реально повыше.

Линк на движок: https://github.com/Niko1221/Strata

Модели, которые нужны Страте: https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF

Пробовали уже?

MrGips • Про LLM / НАШ ЧАТ
GitHub - Niko1221/Strata: Qwen3.8-Flash-Next (125B MoE) on a 8GB+ NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.
Qwen3.8-Flash-Next (125B MoE) on a 8GB+ NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input. - Niko1221/Strata

1.9k 4 163 35 30
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot