Скедулинг AI ворклоудов в k8s
В прошлом посту в статье Kubernetes goes AI-First: Unpacking the new AI conformance program явно упоминается проблема скедулинга AI ворклоудов. Что уже сейчас можно посмотреть на рынке opensource?
1️⃣ Reclaiming underutilized GPUs in Kubernetes using scheduler plugins
Нативный скедулер k8s смотрит на CPU, RAM и ничего не знает про утилизацию GPU. Плагины к скедулеру k8s могут помочь в этом - можно задавать правила по которым происходит фильтрация доступных нод по метрикам Prometheus, например от DCGM exporter.
Статья - https://www.cncf.io/blog/2026/01/20/reclaiming-underutilized-gpus-in-kubernetes-using-scheduler-plugins
Репозиторий - https://github.com/kubernetes-sigs/scheduler-plugins
2️⃣ Running AI Workloads on Rack-Scale Supercomputers: From Hardware to Topology-Aware Scheduling
Nvidia рекомендует переходить к подходам, осведомленным о топологии сети (topology-aware scheduling), используя расширения DRA (тонкое API для работы с вендорным железом), продвинутые мета-планировщики (Run:ai/KAI скедулер) и автоматические инструменты обнаружения железа (Topograph).
Статья - https://developer.nvidia.com/blog/running-ai-workloads-on-rack-scale-supercomputers-from-hardware-to-topology-aware-scheduling/
Репозиторий - https://github.com/NVIDIA/topograph
В прошлом посту в статье Kubernetes goes AI-First: Unpacking the new AI conformance program явно упоминается проблема скедулинга AI ворклоудов. Что уже сейчас можно посмотреть на рынке opensource?
1️⃣ Reclaiming underutilized GPUs in Kubernetes using scheduler plugins
Нативный скедулер k8s смотрит на CPU, RAM и ничего не знает про утилизацию GPU. Плагины к скедулеру k8s могут помочь в этом - можно задавать правила по которым происходит фильтрация доступных нод по метрикам Prometheus, например от DCGM exporter.
Статья - https://www.cncf.io/blog/2026/01/20/reclaiming-underutilized-gpus-in-kubernetes-using-scheduler-plugins
Репозиторий - https://github.com/kubernetes-sigs/scheduler-plugins
2️⃣ Running AI Workloads on Rack-Scale Supercomputers: From Hardware to Topology-Aware Scheduling
Nvidia рекомендует переходить к подходам, осведомленным о топологии сети (topology-aware scheduling), используя расширения DRA (тонкое API для работы с вендорным железом), продвинутые мета-планировщики (Run:ai/KAI скедулер) и автоматические инструменты обнаружения железа (Topograph).
Статья - https://developer.nvidia.com/blog/running-ai-workloads-on-rack-scale-supercomputers-from-hardware-to-topology-aware-scheduling/
Репозиторий - https://github.com/NVIDIA/topograph