Qwen 3.8 Flash Next запустили на мешке с картошкой RTX 5070 12 GB и всего 32 GB RAM
На реддит увидел интересный пост, где запустили большую MoE модель на сетапе, в котором наш Квентин физически не помещается ни в RAM, ни VRAM.
• RTX 5070 - 12 GB VRAM
• Ryzen 5 5600GT
• 32 GB DDR4
• обычный NVMe SSD
Использовался полный Flash Next в UD-IQ3_XXS размером около 76 GB.
Разработчик сделал форк llama.cpp под названием hashyy, который хранит горячие эксперты в VRAM/RAM, а остальные подгружает прямо с SSD по мере необходимости.
И модель выдаёт примерно 11–15 т/с.
Ну да, не густо. Но сам факт запуска полного Flash Next на 12 GB VRAM + 32 GB RAM уже очень интересный.
Форк: https://github.com/MohammadHaishemKhawaja/hashyy
Я сам не пробовал, но кто имеет похожие характеристики компа, можете затестить.
MrGips • Про LLM / НАШ ЧАТ
На реддит увидел интересный пост, где запустили большую MoE модель на сетапе, в котором наш Квентин физически не помещается ни в RAM, ни VRAM.
• RTX 5070 - 12 GB VRAM
• Ryzen 5 5600GT
• 32 GB DDR4
• обычный NVMe SSD
Использовался полный Flash Next в UD-IQ3_XXS размером около 76 GB.
Разработчик сделал форк llama.cpp под названием hashyy, который хранит горячие эксперты в VRAM/RAM, а остальные подгружает прямо с SSD по мере необходимости.
И модель выдаёт примерно 11–15 т/с.
Ну да, не густо. Но сам факт запуска полного Flash Next на 12 GB VRAM + 32 GB RAM уже очень интересный.
Форк: https://github.com/MohammadHaishemKhawaja/hashyy
Я сам не пробовал, но кто имеет похожие характеристики компа, можете затестить.
MrGips • Про LLM / НАШ ЧАТ