TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
AI-DEV IDEA💡

28 May, 22:28

Открыть в Telegram Поделиться Пожаловаться

Репост из: #FUTURE 🚀
🐌 LM Studio + Qwen 3.5/3.6 - почему локальный LLM тормозит

Как выяснилось - LM Studio не передает параметр presence_penalty в llama.cpp. Для Qwen 3.5/3.6 это критично - модель использует именно его чтобы выйти из thinking-режима. Без параметра получается бесконечный chain-of-thought - модель думает, но не отвечает. Та же история с Ollama. Корректно работает только llama.cpp напрямую.

🤒 Симптомы:
Простой ответ занимает 2+ минуты
Vision-модель пишет "да, могу распознать" вместо описания картинки
В логах stream drop: peer closed connection, incomplete chunked read
Прямой curl на тот же endpoint отвечает за секунду

📉 Бенч на RTX 3090: LM Studio 60 tok/s против llama.cpp direct 111 tok/s. Разница 46% не из-за GUI overhead, а из-за неправильной обработки параметров.

🔧 Решение - собрать llama.cpp из master:

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j$(nproc)
./build/bin/llama-server --model your.gguf --ctx-size 131072 \
--n-gpu-layers 999 --port 8000 --threads $(nproc) --flash-attn auto

Для нескольких моделей по очереди (одна в RAM за раз) - llama-swap, proxy с on-demand loading.

❌ Тупиковые ветки на AMD iGPU (Strix Halo gfx1151):
Ollama через ROCm 14 tok/s, через Vulkan - еще хуже
MTP-варианты unsloth - SSM-слои не поддержаны старым llama.cpp
vLLM/SGLang - официальной ROCm 6.3 для gfx115x нет

📊 После перехода на llama.cpp:
Ответы 5-15 секунд вместо 2 минут
Vision корректно описывает изображения
67 tok/s на Qwen3.6-35B-A3B Q4 = ~90% от теоретического memory bandwidth потолка

💡 Полезное по теме:
LLMfit - Rust CLI сканит железо и ранжирует ~1500 моделей по предсказанной скорости
Qwen3-Coder-30B-A3B - оптимально для чата (60+ tok/s, без thinking-mode)
Claude-Opus-Distilled от mudler - дистилляция сломана, выдает план рассказа вместо рассказа
DeepSeek-R1-Distill-Qwen-32B - 5-7 tok/s на iGPU, dense архитектура не лезет в bandwidth

Кому надо, вот простой промт для проверки скорости локальных моделей от @poxek

Set your story at a gathering or event (a wedding, gala, celebration, court feast, etc.) where personal, political, romantic, and/or familial stakes collide.


🔗 https://insiderllm.com/guides/lm-studio-vs-llamacpp-speed-gap/
🔗 https://github.com/ggerganov/llama.cpp
🔗 https://github.com/mostlygeek/llama-swap
🔗 https://github.com/AlexsJones/llmfit

#llm #ai #tools #pentest

Imagine Future
LM Studio vs llama.cpp: Why Your Model Runs Slower in the GUI
LM Studio uses llama.cpp under the hood but often runs 30-50% slower. Bundled runtime lag, UI overhead, and default settings explain the gap. How to benchmark it yourself and when the convenience is worth it.

7 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot