#mlinfra_digest
Снова подборочка от моего разнорабочего.
1️⃣ Speculation Is All You Need
🔎 О чём: Modal показывает, что speculative decoding даёт 2–3x прирост интерактивного inference и выпускает новые DFlash draft models для Qwen.
2️⃣ GKE Inference Gateway prefix caching accelerates AI inference
🔎 О чём: Google описывает prefix-cache-aware routing в GKE Inference Gateway и приводит бенчмарки по throughput, wait time и inter-token latency.
3️⃣ What’s New in the AI Platform: Agents for ML Engineering, Our Deep Learning Platform, and New Capabilities for Real-Time ML
🔎 О чём: Databricks анонсировал serverless GPU AI Runtime, усиление real-time serving и ML-агента, встроенного в feature/training/serving/monitoring контур.
4️⃣ Anyscale on Azure: Powering Enterprise AI at Massive Scale on Azure Kubernetes Service
🔎 О чём: Microsoft и Anyscale продвигают Ray как единый runtime для data prep, training, fine-tuning, inference и agentic execution поверх AKS.
5️⃣ Portable vLLM Model Inference Kernels in Helion
🔎 О чём: PyTorch/Red Hat интегрировали Helion kernels в vLLM для FP8-serving на Qwen3 и показали прирост throughput в fusion-heavy inference path.
Снова подборочка от моего разнорабочего.
1️⃣ Speculation Is All You Need
🔎 О чём: Modal показывает, что speculative decoding даёт 2–3x прирост интерактивного inference и выпускает новые DFlash draft models для Qwen.
2️⃣ GKE Inference Gateway prefix caching accelerates AI inference
🔎 О чём: Google описывает prefix-cache-aware routing в GKE Inference Gateway и приводит бенчмарки по throughput, wait time и inter-token latency.
3️⃣ What’s New in the AI Platform: Agents for ML Engineering, Our Deep Learning Platform, and New Capabilities for Real-Time ML
🔎 О чём: Databricks анонсировал serverless GPU AI Runtime, усиление real-time serving и ML-агента, встроенного в feature/training/serving/monitoring контур.
4️⃣ Anyscale on Azure: Powering Enterprise AI at Massive Scale on Azure Kubernetes Service
🔎 О чём: Microsoft и Anyscale продвигают Ray как единый runtime для data prep, training, fine-tuning, inference и agentic execution поверх AKS.
5️⃣ Portable vLLM Model Inference Kernels in Helion
🔎 О чём: PyTorch/Red Hat интегрировали Helion kernels в vLLM для FP8-serving на Qwen3 и показали прирост throughput в fusion-heavy inference path.