Strata снова ускорили - Qwen3.8 Flash Next уже выходит на 100+ т.с
Подрезал с реддита пост про новую обнову Strata, где еще больше ускорили движок.
Кто здесь новенький, то Strata - это движок для запуска чисто Qwen 3.8 Flash Next (огромной МоЕ модели) на потребительских ПК-шниках.
Он бьет рекорды не только в decode, но и в prompt processing.
Подъехали новые результаты.
На RTX 5070 12 GB:
• ~51 tok/s на IQ3_XXS
• до 1500 tok/s prompt processing
Для сравнения, тот же квант через llama.cpp у меня выдавал около 23 t/s на особом форке, который мне подсказал человек в комметариях. Без этого форка было 16 т/с на 5090.
А в комметах на реддите пользователи уже сообщают:
• RTX 3060 - ~60 tok/s
• RTX 4090 - ~70 tok/s
• RX 7900 XTX - 45–60 tok/s
• RTX 5090 - 100–130 tok/s и до 4–4.5K tok/s prefill
Появился и форк StrataGP, где huge pages дали около +15% скорости на RTX 3060.
Заодно Strata получила 262K контекст, multi-GPU, vision, кеширование диалога и OpenAI/Anthropic API.
Пару недель назад Flash Next на 12 GB VRAM выглядела как эксперимент. Сейчас это уже вполне рабочая локальная MoE-модель с десятками, а на 5090 - сотней токенов в секунду. Но я еще не обновлялся, поэтому это пока отзывы других людей.
Вы уже обновились? Кидайте результаты в комменты!
MrGips • Про LLM / НАШ ЧАТ
Подрезал с реддита пост про новую обнову Strata, где еще больше ускорили движок.
Кто здесь новенький, то Strata - это движок для запуска чисто Qwen 3.8 Flash Next (огромной МоЕ модели) на потребительских ПК-шниках.
Он бьет рекорды не только в decode, но и в prompt processing.
Подъехали новые результаты.
На RTX 5070 12 GB:
• ~51 tok/s на IQ3_XXS
• до 1500 tok/s prompt processing
Для сравнения, тот же квант через llama.cpp у меня выдавал около 23 t/s на особом форке, который мне подсказал человек в комметариях. Без этого форка было 16 т/с на 5090.
А в комметах на реддите пользователи уже сообщают:
• RTX 3060 - ~60 tok/s
• RTX 4090 - ~70 tok/s
• RX 7900 XTX - 45–60 tok/s
• RTX 5090 - 100–130 tok/s и до 4–4.5K tok/s prefill
Появился и форк StrataGP, где huge pages дали около +15% скорости на RTX 3060.
Заодно Strata получила 262K контекст, multi-GPU, vision, кеширование диалога и OpenAI/Anthropic API.
Пару недель назад Flash Next на 12 GB VRAM выглядела как эксперимент. Сейчас это уже вполне рабочая локальная MoE-модель с десятками, а на 5090 - сотней токенов в секунду. Но я еще не обновлялся, поэтому это пока отзывы других людей.
Вы уже обновились? Кидайте результаты в комменты!
MrGips • Про LLM / НАШ ЧАТ