DevOps-инструмент недели: Ray
ML-нагрузка может отлично работать на одной GPU.
Сложности начинаются, когда её нужно масштабировать на несколько GPU, работающих на разных нодах.
Именно здесь помогает Ray.
Ray – это опенсорс фреймворк с 43K+ звёзд на GitHub.
Он помогает организовать распределённое выполнение задач: планирование задач, распределение ресурсов, параллельное выполнение, обмен данными между воркерами и обработку сбоев.
Ray можно запускать на ноутбуке, виртуальных машинах, bare-metal серверах, облачных инстансах или в Kubernetes.
Для Kubernetes обычно используется KubeRay – Kubernetes Operator для создания и управления Ray-кластерами.
Ray используют такие компании, как OpenAI, Uber, Spotify и Instacart, для масштабных AI- и ML-нагрузок.
https://github.com/ray-project/ray
👉 DevOps Portal
ML-нагрузка может отлично работать на одной GPU.
Сложности начинаются, когда её нужно масштабировать на несколько GPU, работающих на разных нодах.
Именно здесь помогает Ray.
Ray – это опенсорс фреймворк с 43K+ звёзд на GitHub.
Он помогает организовать распределённое выполнение задач: планирование задач, распределение ресурсов, параллельное выполнение, обмен данными между воркерами и обработку сбоев.
Ray можно запускать на ноутбуке, виртуальных машинах, bare-metal серверах, облачных инстансах или в Kubernetes.
Для Kubernetes обычно используется KubeRay – Kubernetes Operator для создания и управления Ray-кластерами.
Ray используют такие компании, как OpenAI, Uber, Spotify и Instacart, для масштабных AI- и ML-нагрузок.
https://github.com/ray-project/ray
👉 DevOps Portal