Хеллоу!
#mlinfra_digest
Сегодня дайджест выходит на денек раньше. А знаете почему? Конечно знаете, завтра буду уже традиционно выступать на MLечный путь 2026, обязательно приходите или подключайтесь онлайн)
А пока ждем это событие, предлагаю посмотреть на следующие интересные статьи за последнее время.
1️⃣ State of the Model Serving Communities
Хорошая сводка последних апдейтов по open source serving/inference-проектам. Удобно, когда хочется быстро сверить, что происходит вокруг KServe, Gateway API Inference Extension, llm-d и соседних инициатив, не вычитывая десятки отдельных анонсов.
https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93
2️⃣ Unifying real-time and async inference with GKE Inference Gateway
Интересный практический разбор того, как делать асинхронный inference и при этом не разводить отдельные serving-контуры под каждый тип нагрузки.
И что особенно приятно, async inference тут уже можно не только читать как идею, но и реально трогать руками, например через llm-d async и Async Processor.
Статья - https://cloud.google.com/blog/products/containers-kubernetes/unifying-real-time-and-async-inference-with-gke-inference-gateway
Репозиторий - https://github.com/llm-d-incubation/llm-d-async/blob/main/README.md
Дока - https://llm-d.ai/docs/guide/Installation/asynchronous-processing
3️⃣ Optimizing RDMA performance for AI workloads on AKS with DRANET
А вот это уже более low-level infra история, и снова про DRA! Тут речь про RDMA, топологию деплоя ворклоудов (чтобы они были поближе друг-к-другу и соеденены каким-нибудь nvlink). Вещи, которые реально начинают влиять на latency и throughput, когда выходишь за рамки простого single-node serving.
DRA расматривается как решение не только для GPU - это общий стандарт, сетевая топология тоже будет имплементироваться через ResourceClaim'ы.
https://blog.aks.azure.com/2026/04/01/dranet-rdma-optimization-for-ai-on-aks
#mlinfra_digest
Сегодня дайджест выходит на денек раньше. А знаете почему? Конечно знаете, завтра буду уже традиционно выступать на MLечный путь 2026, обязательно приходите или подключайтесь онлайн)
А пока ждем это событие, предлагаю посмотреть на следующие интересные статьи за последнее время.
1️⃣ State of the Model Serving Communities
Хорошая сводка последних апдейтов по open source serving/inference-проектам. Удобно, когда хочется быстро сверить, что происходит вокруг KServe, Gateway API Inference Extension, llm-d и соседних инициатив, не вычитывая десятки отдельных анонсов.
https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93
2️⃣ Unifying real-time and async inference with GKE Inference Gateway
Интересный практический разбор того, как делать асинхронный inference и при этом не разводить отдельные serving-контуры под каждый тип нагрузки.
И что особенно приятно, async inference тут уже можно не только читать как идею, но и реально трогать руками, например через llm-d async и Async Processor.
Статья - https://cloud.google.com/blog/products/containers-kubernetes/unifying-real-time-and-async-inference-with-gke-inference-gateway
Репозиторий - https://github.com/llm-d-incubation/llm-d-async/blob/main/README.md
Дока - https://llm-d.ai/docs/guide/Installation/asynchronous-processing
3️⃣ Optimizing RDMA performance for AI workloads on AKS with DRANET
А вот это уже более low-level infra история, и снова про DRA! Тут речь про RDMA, топологию деплоя ворклоудов (чтобы они были поближе друг-к-другу и соеденены каким-нибудь nvlink). Вещи, которые реально начинают влиять на latency и throughput, когда выходишь за рамки простого single-node serving.
DRA расматривается как решение не только для GPU - это общий стандарт, сетевая топология тоже будет имплементироваться через ResourceClaim'ы.
https://blog.aks.azure.com/2026/04/01/dranet-rdma-optimization-for-ai-on-aks