Qwen-3.8-Flash-Next вышла
Экспериментальная модель для тестирования архитектуры будущей Qwen4:
- MoE с Engram: 125B параметров в целом, 6B активных, 51B Engram (можно сгружать в RAM).
- По бенчмаркам кое-где обходит Deepseek V4 Flash, кое-где позади.
- Куча оптимизации для обучения и инференса.
- Свой вариант атеншена.
Веса, блогпост, техрепорт
Экспериментальная модель для тестирования архитектуры будущей Qwen4:
- MoE с Engram: 125B параметров в целом, 6B активных, 51B Engram (можно сгружать в RAM).
- По бенчмаркам кое-где обходит Deepseek V4 Flash, кое-где позади.
- Куча оптимизации для обучения и инференса.
- Свой вариант атеншена.
Веса, блогпост, техрепорт