Хотел почеленджить ребят на работе, что развернуть модельки просто. А именно попробовав серверные истории SGLang, vLLM или Triton. А вот от llama.cpp отказался, тк больше про локальный инференс, хотя через lm studio было бы легко
Но везде оказались свои подводные камни. И как итог, Qwen3.8-9B-GGUF (Q4/Q5) вообще плохо поддерживается vLLM. Патч под Qwen 3.5 от некого чувака, который 24 часа делал его на Fable, тоже не помог. Плюс были проблемы с CUDA DLL и ZMQ.
При этом исходные оригинальные веса зачастую требуют слишком много памяти, а квантованные, которые собирают сторонние люди, уже поддерживаются заметно хуже.
Потом попробовал Gemma 4 E4B (safetensors и QAT самые разные версии), но vLLM и SGLang тоже не завелись из-за проблем с совместимостью compressed-tensors и мультимодальными особенностям, спасибо еще heterogeneous attention head dimensions
PS qwen 3.8 27b локально это прогрев
Но везде оказались свои подводные камни. И как итог, Qwen3.8-9B-GGUF (Q4/Q5) вообще плохо поддерживается vLLM. Патч под Qwen 3.5 от некого чувака, который 24 часа делал его на Fable, тоже не помог. Плюс были проблемы с CUDA DLL и ZMQ.
При этом исходные оригинальные веса зачастую требуют слишком много памяти, а квантованные, которые собирают сторонние люди, уже поддерживаются заметно хуже.
Потом попробовал Gemma 4 E4B (safetensors и QAT самые разные версии), но vLLM и SGLang тоже не завелись из-за проблем с совместимостью compressed-tensors и мультимодальными особенностям, спасибо еще heterogeneous attention head dimensions
PS qwen 3.8 27b локально это прогрев