NVIDIA заявила о 30-кратном росте эффективности Vera Rubin NVL72 для AI-агентов
По новым замерам NVIDIA, система Vera Rubin NVL72 показывает до 30x больше throughput на мегаватт и до 35x меньшую стоимость токенов по сравнению с GB300 NVL72 на агентных нагрузках.
Тестировали не обычный чат, а реальные coding-сессии из SemiAnalysis AgentX: длинный растущий контекст, вызовы инструментов, запуск субагентов и многошаговое рассуждение. По данным OpenRouter, такие сценарии могут потреблять примерно в 15 раз больше токенов, чем обычный запрос в чат.
В Vera Rubin NVIDIA отдельно оптимизировала работу с длинным контекстом: distributed KV-cache, KV-aware routing, разделение prefill и decode, expert parallelism и новые CUDA-кернелы.
На DeepSeek V4 Pro Vera Rubin NVL72, по данным NVIDIA, даёт до 30x больше throughput на мегаватт относительно GB300 NVL72. Эти результаты пока ожидают проверки SemiAnalysis.
https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents/
По новым замерам NVIDIA, система Vera Rubin NVL72 показывает до 30x больше throughput на мегаватт и до 35x меньшую стоимость токенов по сравнению с GB300 NVL72 на агентных нагрузках.
Тестировали не обычный чат, а реальные coding-сессии из SemiAnalysis AgentX: длинный растущий контекст, вызовы инструментов, запуск субагентов и многошаговое рассуждение. По данным OpenRouter, такие сценарии могут потреблять примерно в 15 раз больше токенов, чем обычный запрос в чат.
В Vera Rubin NVIDIA отдельно оптимизировала работу с длинным контекстом: distributed KV-cache, KV-aware routing, разделение prefill и decode, expert parallelism и новые CUDA-кернелы.
На DeepSeek V4 Pro Vera Rubin NVL72, по данным NVIDIA, даёт до 30x больше throughput на мегаватт относительно GB300 NVL72. Эти результаты пока ожидают проверки SemiAnalysis.
https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents/