Локальная LLM на GPU: что важно при развертывании
Запустить нейросеть на собственном сервере сегодня можно без сложной инфраструктуры. Связка Ollama + Open WebUI на Ubuntu 24.04 собирается за несколько часов, но основная сложность начинается после установки: нужно правильно подобрать GPU, настроить доступ к видеокарте, закрыть внешний контур и организовать эксплуатацию.
Первое, с чего стоит начать, это выбор видеокарты. Объём VRAM определяет, какие модели можно запускать, а пропускная способность памяти напрямую влияет на скорость генерации. Например, для модели 7–8B в Q4_K_M достаточно ориентироваться примерно на 12 ГБ VRAM, для 27–32B потребуется уже 24–32 ГБ, а для 70B понадобится 48–64 ГБ и выше.
При этом объём модели не равен объёму необходимой видеопамяти. К весам добавляется KV-кэш, который растёт вместе с длиной контекста, поэтому брать карту «впритык» рискованно.
Вторая критическая зона, драйвер NVIDIA. На Ubuntu 24.04 проблемы с nouveau, Secure Boot или модулем после обновления ядра могут привести к тому, что Ollama начнёт считать на CPU. Проверять нужно не только наличие драйвера через nvidia-smi, но и фактическое распределение модели. Команда ollama ps показывает, какая часть нагрузки приходится на GPU.
Отдельный вопрос, безопасность. Open WebUI нельзя просто выставить в интернет на открытом порту. В статье разбираем схему с Nginx, SSL и firewall, а также показываем, почему публикация Docker-порта без привязки к 127.0.0.1 может обойти правила ufw.
И наконец, локальная LLM требует обычной эксплуатации: резервного копирования данных Open WebUI, контроля загрузки GPU, обновлений и мониторинга. Сами модели при этом можно не включать в бэкап, их достаточно загрузить заново.
В блоге собрали полный маршрут: от выбора GPU и установки драйверов до Docker Compose, Nginx, SSL, проверки производительности и типовых ошибок. Если планируете поднять собственный AI-сервис, эта инструкция поможет пройти путь без лишних экспериментов.
Запустить нейросеть на собственном сервере сегодня можно без сложной инфраструктуры. Связка Ollama + Open WebUI на Ubuntu 24.04 собирается за несколько часов, но основная сложность начинается после установки: нужно правильно подобрать GPU, настроить доступ к видеокарте, закрыть внешний контур и организовать эксплуатацию.
Первое, с чего стоит начать, это выбор видеокарты. Объём VRAM определяет, какие модели можно запускать, а пропускная способность памяти напрямую влияет на скорость генерации. Например, для модели 7–8B в Q4_K_M достаточно ориентироваться примерно на 12 ГБ VRAM, для 27–32B потребуется уже 24–32 ГБ, а для 70B понадобится 48–64 ГБ и выше.
При этом объём модели не равен объёму необходимой видеопамяти. К весам добавляется KV-кэш, который растёт вместе с длиной контекста, поэтому брать карту «впритык» рискованно.
Вторая критическая зона, драйвер NVIDIA. На Ubuntu 24.04 проблемы с nouveau, Secure Boot или модулем после обновления ядра могут привести к тому, что Ollama начнёт считать на CPU. Проверять нужно не только наличие драйвера через nvidia-smi, но и фактическое распределение модели. Команда ollama ps показывает, какая часть нагрузки приходится на GPU.
Отдельный вопрос, безопасность. Open WebUI нельзя просто выставить в интернет на открытом порту. В статье разбираем схему с Nginx, SSL и firewall, а также показываем, почему публикация Docker-порта без привязки к 127.0.0.1 может обойти правила ufw.
И наконец, локальная LLM требует обычной эксплуатации: резервного копирования данных Open WebUI, контроля загрузки GPU, обновлений и мониторинга. Сами модели при этом можно не включать в бэкап, их достаточно загрузить заново.
В блоге собрали полный маршрут: от выбора GPU и установки драйверов до Docker Compose, Nginx, SSL, проверки производительности и типовых ошибок. Если планируете поднять собственный AI-сервис, эта инструкция поможет пройти путь без лишних экспериментов.