TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Cloud4U - облачный провайдер

23 Aug, 12:04

Открыть в Telegram Поделиться Пожаловаться

Локальная LLM на GPU: что важно при развертывании

Запустить нейросеть на собственном сервере сегодня можно без сложной инфраструктуры. Связка Ollama + Open WebUI на Ubuntu 24.04 собирается за несколько часов, но основная сложность начинается после установки: нужно правильно подобрать GPU, настроить доступ к видеокарте, закрыть внешний контур и организовать эксплуатацию.

Первое, с чего стоит начать, это выбор видеокарты. Объём VRAM определяет, какие модели можно запускать, а пропускная способность памяти напрямую влияет на скорость генерации. Например, для модели 7–8B в Q4_K_M достаточно ориентироваться примерно на 12 ГБ VRAM, для 27–32B потребуется уже 24–32 ГБ, а для 70B понадобится 48–64 ГБ и выше.

При этом объём модели не равен объёму необходимой видеопамяти. К весам добавляется KV-кэш, который растёт вместе с длиной контекста, поэтому брать карту «впритык» рискованно.

Вторая критическая зона, драйвер NVIDIA. На Ubuntu 24.04 проблемы с nouveau, Secure Boot или модулем после обновления ядра могут привести к тому, что Ollama начнёт считать на CPU. Проверять нужно не только наличие драйвера через nvidia-smi, но и фактическое распределение модели. Команда ollama ps показывает, какая часть нагрузки приходится на GPU.

Отдельный вопрос, безопасность. Open WebUI нельзя просто выставить в интернет на открытом порту. В статье разбираем схему с Nginx, SSL и firewall, а также показываем, почему публикация Docker-порта без привязки к 127.0.0.1 может обойти правила ufw.

И наконец, локальная LLM требует обычной эксплуатации: резервного копирования данных Open WebUI, контроля загрузки GPU, обновлений и мониторинга. Сами модели при этом можно не включать в бэкап, их достаточно загрузить заново.

В блоге собрали полный маршрут: от выбора GPU и установки драйверов до Docker Compose, Nginx, SSL, проверки производительности и типовых ошибок. Если планируете поднять собственный AI-сервис, эта инструкция поможет пройти путь без лишних экспериментов.

85 0 1
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot