iska dev
Репост из: DevSecOps Talks
LLM Inference в Kubernetes
Всем привет!
Статья описывает опыт Автора, в которой он разворачивает LLM-модель локально, в своём кластере Kubernetes.
Для этого он использует следующие технологии: vLLM, KEDA, GAIE, llm-d, Karpenter и не только.
После небольшого взгляда на концептуальную архитектуру предлагаемого решения начинается самое интересное – реализация.
Автор описывает разделы:
🍭 Использование Karpenter для управления GPU-узлами
🍭 О чём важно помнить при работе с GPU в Kubernetes
🍭 Настройка Ingress и TLS с Istio и Cert Manager
🍭 Установка и настройка модели (qwen-3.6-27B-fp8)
🍭 Конфигурация автоматического масштабирования с использованием Keda и не только
🍭 Настройка мониторинга, контроль использования GPU
Весь путь, пройденный Автором, описан максимально детально: все команды, конфигурационные файлы, ссылки на инструментарий, важные уточнения (опыт, полученный на ошибках) – всё это есть в статье.
Если вы думали реализовать нечто подобное, то статья точно может быть вам полезной!
Всем привет!
Статья описывает опыт Автора, в которой он разворачивает LLM-модель локально, в своём кластере Kubernetes.
Для этого он использует следующие технологии: vLLM, KEDA, GAIE, llm-d, Karpenter и не только.
После небольшого взгляда на концептуальную архитектуру предлагаемого решения начинается самое интересное – реализация.
Автор описывает разделы:
🍭 Использование Karpenter для управления GPU-узлами
🍭 О чём важно помнить при работе с GPU в Kubernetes
🍭 Настройка Ingress и TLS с Istio и Cert Manager
🍭 Установка и настройка модели (qwen-3.6-27B-fp8)
🍭 Конфигурация автоматического масштабирования с использованием Keda и не только
🍭 Настройка мониторинга, контроль использования GPU
Весь путь, пройденный Автором, описан максимально детально: все команды, конфигурационные файлы, ссылки на инструментарий, важные уточнения (опыт, полученный на ошибках) – всё это есть в статье.
Если вы думали реализовать нечто подобное, то статья точно может быть вам полезной!