TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
MrGips • Про LLM

30 Sep, 13:10

Открыть в Telegram Поделиться Пожаловаться

Strata снова ускорили - Qwen3.8 Flash Next уже выходит на 100+ т.с

Подрезал с реддита пост про новую обнову Strata, где еще больше ускорили движок.

Кто здесь новенький, то Strata - это движок для запуска чисто Qwen 3.8 Flash Next (огромной МоЕ модели) на потребительских ПК-шниках.

Он бьет рекорды не только в decode, но и в prompt processing.

Подъехали новые результаты.

На RTX 5070 12 GB:

• ~51 tok/s на IQ3_XXS
• до 1500 tok/s prompt processing

Для сравнения, тот же квант через llama.cpp у меня выдавал около 23 t/s на особом форке, который мне подсказал человек в комметариях. Без этого форка было 16 т/с на 5090.

А в комметах на реддите пользователи уже сообщают:

• RTX 3060 - ~60 tok/s
• RTX 4090 - ~70 tok/s
• RX 7900 XTX - 45–60 tok/s
• RTX 5090 - 100–130 tok/s и до 4–4.5K tok/s prefill

Появился и форк StrataGP, где huge pages дали около +15% скорости на RTX 3060.

Заодно Strata получила 262K контекст, multi-GPU, vision, кеширование диалога и OpenAI/Anthropic API.

Пару недель назад Flash Next на 12 GB VRAM выглядела как эксперимент. Сейчас это уже вполне рабочая локальная MoE-модель с десятками, а на 5090 - сотней токенов в секунду. Но я еще не обновлялся, поэтому это пока отзывы других людей.

Вы уже обновились? Кидайте результаты в комменты!

MrGips • Про LLM / НАШ ЧАТ
GitHub - Niko1221/Strata: Qwen3.8-Flash-Next (125B MoE) on a 8GB+ NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.
Qwen3.8-Flash-Next (125B MoE) on a 8GB+ NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input. - Niko1221/Strata

1.3k 0 79 136 30
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot