Всем привет!
#mlinfra_digest
Настроил для себя ресерч материалов по инфраструктуре для AI/ML. Самые интересные статьи и посты хочу иногда выкладывать на канале.
Тут не будет новостей про новые SOTA модели, как агенты научились вышивать или что очередная голливудская звезда завела репозиторий на гитхабе (привет Милла Йовович)- только инфраструктурная выжимка про готовку ai платформ (в том числе для ваших агентов).
1️⃣ The weight of AI models: Why infrastructure always arrives slowly
Очень хороший текст про то, что bottleneck в AI infra часто не в самой модели, а в доставке, хранении и rollout больших весов.
Как то я уже делал посты про DragonFly p2p, но для оптимизации пуллинга образов. Посмотрим как он может помочь с весами моделей - веса делятся на слои как докер образ и скачиваются с разных нод. Модельки через торрент))
https://www.cncf.io/blog/2026/03/27/the-weight-of-ai-models-why-infrastructure-always-arrives-slowly/
2️⃣ Kubernetes goes AI-First: Unpacking the new AI conformance program
Один из самых сильных сигналов про то, какие capability скоро станут baseline для AI-ready Kubernetes: DRA, AI-aware autoscaling, observability, scheduling.
DRA на западе становится стандартом, в любом KibeConf про это доклад (а еще он уже в бете и динамический MIG подвезли). Скейлинг по утилизации GPU кажется необходимой частью таких платформ.
https://opensource.googleblog.com/2026/04/kubernetes-goes-ai-first-unpacking-the-new-ai-conformance-program.html
3️⃣ The platform under the model: How cloud native powers AI engineering in production
Хороший обзорный материал, который собирает в одну картину cloud-native substrate под AI workloads. Особенно нравится видеть там Kueue, Kubeflow - ну в целом проекты cncf так что ничего удивительного
Удобно, если хочется быстро сверить свою roadmap и понять, из каких примитивов вообще сейчас складывается production AI platform.
https://www.cncf.io/blog/2026/03/26/the-platform-under-the-model-how-cloud-native-powers-ai-engineering-in-production/
4️⃣ How NVIDIA Dynamo 1.0 Powers Multi-Node Inference at Production Scale
А здесь будет две статьи про распределенный инференс. Делимся на два лагеря - кто за dynamo AI пишите в комментах насколько вам помогает disaggregated inference, стабильны ли ваши TPOT.
https://developer.nvidia.com/blog/nvidia-dynamo-1-production-ready/
5️⃣ llm-d officially a CNCF Sandbox project
А я лично больше присматриваюсь к llm-d - cncf sandbox это хороший знак, но что еще важнее он поддержан в Kserve)
https://cloud.google.com/blog/products/containers-kubernetes/llm-d-officially-a-cncf-sandbox-project
#mlinfra_digest
Настроил для себя ресерч материалов по инфраструктуре для AI/ML. Самые интересные статьи и посты хочу иногда выкладывать на канале.
Тут не будет новостей про новые SOTA модели, как агенты научились вышивать или что очередная голливудская звезда завела репозиторий на гитхабе (привет Милла Йовович)- только инфраструктурная выжимка про готовку ai платформ (в том числе для ваших агентов).
1️⃣ The weight of AI models: Why infrastructure always arrives slowly
Очень хороший текст про то, что bottleneck в AI infra часто не в самой модели, а в доставке, хранении и rollout больших весов.
Как то я уже делал посты про DragonFly p2p, но для оптимизации пуллинга образов. Посмотрим как он может помочь с весами моделей - веса делятся на слои как докер образ и скачиваются с разных нод. Модельки через торрент))
https://www.cncf.io/blog/2026/03/27/the-weight-of-ai-models-why-infrastructure-always-arrives-slowly/
2️⃣ Kubernetes goes AI-First: Unpacking the new AI conformance program
Один из самых сильных сигналов про то, какие capability скоро станут baseline для AI-ready Kubernetes: DRA, AI-aware autoscaling, observability, scheduling.
DRA на западе становится стандартом, в любом KibeConf про это доклад (а еще он уже в бете и динамический MIG подвезли). Скейлинг по утилизации GPU кажется необходимой частью таких платформ.
https://opensource.googleblog.com/2026/04/kubernetes-goes-ai-first-unpacking-the-new-ai-conformance-program.html
3️⃣ The platform under the model: How cloud native powers AI engineering in production
Хороший обзорный материал, который собирает в одну картину cloud-native substrate под AI workloads. Особенно нравится видеть там Kueue, Kubeflow - ну в целом проекты cncf так что ничего удивительного
Удобно, если хочется быстро сверить свою roadmap и понять, из каких примитивов вообще сейчас складывается production AI platform.
https://www.cncf.io/blog/2026/03/26/the-platform-under-the-model-how-cloud-native-powers-ai-engineering-in-production/
4️⃣ How NVIDIA Dynamo 1.0 Powers Multi-Node Inference at Production Scale
А здесь будет две статьи про распределенный инференс. Делимся на два лагеря - кто за dynamo AI пишите в комментах насколько вам помогает disaggregated inference, стабильны ли ваши TPOT.
https://developer.nvidia.com/blog/nvidia-dynamo-1-production-ready/
5️⃣ llm-d officially a CNCF Sandbox project
А я лично больше присматриваюсь к llm-d - cncf sandbox это хороший знак, но что еще важнее он поддержан в Kserve)
https://cloud.google.com/blog/products/containers-kubernetes/llm-d-officially-a-cncf-sandbox-project