Репост из: #FUTURE 🚀
🐌 LM Studio + Qwen 3.5/3.6 - почему локальный LLM тормозит
Как выяснилось - LM Studio не передает параметр presence_penalty в llama.cpp. Для Qwen 3.5/3.6 это критично - модель использует именно его чтобы выйти из thinking-режима. Без параметра получается бесконечный chain-of-thought - модель думает, но не отвечает. Та же история с Ollama. Корректно работает только llama.cpp напрямую.
🤒 Симптомы:
Простой ответ занимает 2+ минуты
Vision-модель пишет "да, могу распознать" вместо описания картинки
В логах stream drop: peer closed connection, incomplete chunked read
Прямой curl на тот же endpoint отвечает за секунду
📉 Бенч на RTX 3090: LM Studio 60 tok/s против llama.cpp direct 111 tok/s. Разница 46% не из-за GUI overhead, а из-за неправильной обработки параметров.
🔧 Решение - собрать llama.cpp из master:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j$(nproc)
./build/bin/llama-server --model your.gguf --ctx-size 131072 \
--n-gpu-layers 999 --port 8000 --threads $(nproc) --flash-attn auto
Для нескольких моделей по очереди (одна в RAM за раз) - llama-swap, proxy с on-demand loading.
❌ Тупиковые ветки на AMD iGPU (Strix Halo gfx1151):
Ollama через ROCm 14 tok/s, через Vulkan - еще хуже
MTP-варианты unsloth - SSM-слои не поддержаны старым llama.cpp
vLLM/SGLang - официальной ROCm 6.3 для gfx115x нет
📊 После перехода на llama.cpp:
Ответы 5-15 секунд вместо 2 минут
Vision корректно описывает изображения
67 tok/s на Qwen3.6-35B-A3B Q4 = ~90% от теоретического memory bandwidth потолка
💡 Полезное по теме:
LLMfit - Rust CLI сканит железо и ранжирует ~1500 моделей по предсказанной скорости
Qwen3-Coder-30B-A3B - оптимально для чата (60+ tok/s, без thinking-mode)
Claude-Opus-Distilled от mudler - дистилляция сломана, выдает план рассказа вместо рассказа
DeepSeek-R1-Distill-Qwen-32B - 5-7 tok/s на iGPU, dense архитектура не лезет в bandwidth
Кому надо, вот простой промт для проверки скорости локальных моделей от @poxek
Set your story at a gathering or event (a wedding, gala, celebration, court feast, etc.) where personal, political, romantic, and/or familial stakes collide.
🔗 https://insiderllm.com/guides/lm-studio-vs-llamacpp-speed-gap/
🔗 https://github.com/ggerganov/llama.cpp
🔗 https://github.com/mostlygeek/llama-swap
🔗 https://github.com/AlexsJones/llmfit
#llm #ai #tools #pentest
Imagine Future
Как выяснилось - LM Studio не передает параметр presence_penalty в llama.cpp. Для Qwen 3.5/3.6 это критично - модель использует именно его чтобы выйти из thinking-режима. Без параметра получается бесконечный chain-of-thought - модель думает, но не отвечает. Та же история с Ollama. Корректно работает только llama.cpp напрямую.
🤒 Симптомы:
Простой ответ занимает 2+ минуты
Vision-модель пишет "да, могу распознать" вместо описания картинки
В логах stream drop: peer closed connection, incomplete chunked read
Прямой curl на тот же endpoint отвечает за секунду
📉 Бенч на RTX 3090: LM Studio 60 tok/s против llama.cpp direct 111 tok/s. Разница 46% не из-за GUI overhead, а из-за неправильной обработки параметров.
🔧 Решение - собрать llama.cpp из master:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j$(nproc)
./build/bin/llama-server --model your.gguf --ctx-size 131072 \
--n-gpu-layers 999 --port 8000 --threads $(nproc) --flash-attn auto
Для нескольких моделей по очереди (одна в RAM за раз) - llama-swap, proxy с on-demand loading.
❌ Тупиковые ветки на AMD iGPU (Strix Halo gfx1151):
Ollama через ROCm 14 tok/s, через Vulkan - еще хуже
MTP-варианты unsloth - SSM-слои не поддержаны старым llama.cpp
vLLM/SGLang - официальной ROCm 6.3 для gfx115x нет
📊 После перехода на llama.cpp:
Ответы 5-15 секунд вместо 2 минут
Vision корректно описывает изображения
67 tok/s на Qwen3.6-35B-A3B Q4 = ~90% от теоретического memory bandwidth потолка
💡 Полезное по теме:
LLMfit - Rust CLI сканит железо и ранжирует ~1500 моделей по предсказанной скорости
Qwen3-Coder-30B-A3B - оптимально для чата (60+ tok/s, без thinking-mode)
Claude-Opus-Distilled от mudler - дистилляция сломана, выдает план рассказа вместо рассказа
DeepSeek-R1-Distill-Qwen-32B - 5-7 tok/s на iGPU, dense архитектура не лезет в bandwidth
Кому надо, вот простой промт для проверки скорости локальных моделей от @poxek
Set your story at a gathering or event (a wedding, gala, celebration, court feast, etc.) where personal, political, romantic, and/or familial stakes collide.
🔗 https://insiderllm.com/guides/lm-studio-vs-llamacpp-speed-gap/
🔗 https://github.com/ggerganov/llama.cpp
🔗 https://github.com/mostlygeek/llama-swap
🔗 https://github.com/AlexsJones/llmfit
#llm #ai #tools #pentest
Imagine Future