GPU для ИИ‑сервиса часто докупают, когда он перестаёт справляться в проде. Но обычно дело не в количестве карт. Важно понимать, как запущена модель, сколько памяти съедает KV‑cache и какой GPU‑профиль нужен именно этому сервису.
Александр Подмосковный, директор продуктового направления ML/AI/GPU в «Фланте», покажет, как это решают в Deckhouse Platform.
Разберёт два уровня:
• планировщик инференса — ещё до запуска оценивает модель и сервис по квантованию, контексту, KV‑cache и допустимой задержке, а затем строит план запуска: среду исполнения, GPU‑профиль, режим шаринга;
• контур управления GPU исполняет этот план на реальном железе через DRA‑заявки, GPU‑инвентарь, MPS‑шаринг и scheduler extender для размещения нагрузок.
На примере ИИ‑ассистента с RAG покажет, как один сервис раскладывается на LLM, embeddings, reranker, OCR/STT/TTS и агентные сценарии. У каждой части свой GPU‑профиль: где‑то нужна целая GPU, где‑то MIG, где‑то доля по MPS.
23 сентября, 18:00, SmartData.