Всем привет!
#mlinfra_digest
Пока смотрю свежие материалы по инфраструктуре для AI/ML, всё сильнее ощущение, что основная сложность уже давно не в том, как поднять модель, а в том, как потом всем этим нормально управлять в production.
1️⃣ Experimenting with GPUs: GKE managed DRANET and Inference Gateway AI Deployment
Хороший материал от Google про DRANET и inference gateway как отдельный слой платформы для AI-нагрузок.
Плюс inference gateway уже можно смотреть не только как идею из вендорских постов, но и как расширение Kubernetes Gateway API, которое уже хочется руками тестировать.
https://cloud.google.com/blog/topics/developers-practitioners/experimenting-with-gpus-gke-managed-dranet-and-inference-gateway-ai-deployment
https://github.com/kubernetes-sigs/gateway-api-inference-extension
2️⃣ Unlock efficient model deployment: Simplified Inference Operator setup on Amazon SageMaker HyperPod
У AWS понравился сам подход к inference operator. Если хочется писать свой оператор для inference platform, полезно посмотреть, как это разложено у них: lifecycle, rollout и platform-style управление serving-слоем. Особенно если KServe вам по каким-то причинам не подходит и хочется собирать более кастомный control plane.
https://aws.amazon.com/blogs/architecture/unlock-efficient-model-deployment-simplified-inference-operator-setup-on-amazon-sagemaker-hyperpod/
3️⃣ Overcoming inference challenges
У Red Hat понравилась простая и очень жизненная мысль: первый успешный ответ от модели это не победа, а только старт. Дальше начинается Day 2, где нужно разруливать hardware-model Tetris, latency/throughput trade-offs, стоимость и утилизацию GPU. И именно там быстро становится видно, есть ли у тебя inference platform, или пока просто набор YAML’ов.
https://www.redhat.com/en/blog/overcoming-inference-challenges
#mlinfra_digest
Пока смотрю свежие материалы по инфраструктуре для AI/ML, всё сильнее ощущение, что основная сложность уже давно не в том, как поднять модель, а в том, как потом всем этим нормально управлять в production.
1️⃣ Experimenting with GPUs: GKE managed DRANET and Inference Gateway AI Deployment
Хороший материал от Google про DRANET и inference gateway как отдельный слой платформы для AI-нагрузок.
Плюс inference gateway уже можно смотреть не только как идею из вендорских постов, но и как расширение Kubernetes Gateway API, которое уже хочется руками тестировать.
https://cloud.google.com/blog/topics/developers-practitioners/experimenting-with-gpus-gke-managed-dranet-and-inference-gateway-ai-deployment
https://github.com/kubernetes-sigs/gateway-api-inference-extension
2️⃣ Unlock efficient model deployment: Simplified Inference Operator setup on Amazon SageMaker HyperPod
У AWS понравился сам подход к inference operator. Если хочется писать свой оператор для inference platform, полезно посмотреть, как это разложено у них: lifecycle, rollout и platform-style управление serving-слоем. Особенно если KServe вам по каким-то причинам не подходит и хочется собирать более кастомный control plane.
https://aws.amazon.com/blogs/architecture/unlock-efficient-model-deployment-simplified-inference-operator-setup-on-amazon-sagemaker-hyperpod/
3️⃣ Overcoming inference challenges
У Red Hat понравилась простая и очень жизненная мысль: первый успешный ответ от модели это не победа, а только старт. Дальше начинается Day 2, где нужно разруливать hardware-model Tetris, latency/throughput trade-offs, стоимость и утилизацию GPU. И именно там быстро становится видно, есть ли у тебя inference platform, или пока просто набор YAML’ов.
https://www.redhat.com/en/blog/overcoming-inference-challenges