NVIDIA Vera Rubin NVL72声称在Agentic AI推理中每兆瓦吞吐量提升 30 倍

NVIDIA发布的Vera Rubin NVL72预览结果基于SemiAnalysis AgentX基准测试,显示其相对于GB300 NVL72,在每兆瓦AI工厂吞吐量上最高提升 30 倍,同时GB300 NVL72相比H200 NVL8在类似动态工作负载下的每兆瓦吞吐量优势最高达 15 倍。

AI解读:AI代理推理比传统聊天消耗更多计算资源,某些情况下单个代理请求的token消耗量可达普通聊天的 15 倍。NVIDIA引用了新的AgentX基准测试,该测试通过回放真实的编码代理会话来衡量服务器效率。Vera Rubin NVL72的预览结果显示,其每兆瓦吞吐量比上一代产品GB300 NVL72高出 30 倍,这意味着运营商可以在相同的功耗预算内支持更多AI代理,或降低成本。不过,这些结果由NVIDIA自行测量,尚待SemiAnalysis审核,属于预览数据。

NVIDIA在技术博客中发布了Vera Rubin NVL72的预览性能数据:使用SemiAnalysis AgentX工作负载,在目标为每秒每用户 160 tokens的交互速度下,其每兆瓦AI工厂吞吐量比GB300 NVL72最高提升 30 倍。该结果由NVIDIA测量,尚待SemiAnalysis审核。

NVIDIA同时公布了GB300 NVL72在AgentX测试中的结果:与H200 NVL8相比,在DeepSeek V4 Pro 1.6T模型下每兆瓦吞吐量最高提升 15 倍,在Kimi K3 2.8T模型下每兆瓦吞吐量最高提升约 80 倍,且后者将每用户每秒交互速度上限扩展至约 215 tokens。

这些数据来自NVIDIA发布的基准测试预览,用于展示其硬件在代理式AI推理工作负载下的性能表现。

AgentX基准测试方法

AgentX是SemiAnalysis开源基准测试套件InferenceX中的一部分,专门用于评估加速器在代理式编码推理中的服务效率。该基准回放预录的Claude Code会话,这些会话包含交错的推理和工具调用,每个系统接收相同的流量,以比较服务栈而非特定调优的效果。

与传统的固定序列长度测试不同,AgentX保留了会话的长度、时机及KV缓存压力,并变化并发度以映射吞吐量与交互性之间的权衡。其主要指标为每兆瓦tokens数,并报告端到端规范化交互性、标准交互性、端到端延迟和首token时间。

  • 之前的InferenceX静态 8K/1K序列测试中,GB300 NVL72比H200的每兆瓦token数领先最多 40 倍,但这种场景缺乏代理工作负载的动态性。
  • NVIDIA将AgentX描述为更贴近真实代理流量,而固定序列长度的测试模式已在InferenceX中降级为“维护模式”。

Vera Rubin NVL72的性能亮点

NVIDIA在博客中称,Vera Rubin NVL72的预览结果基于AgentX的DeepSeek V4-Pro工作负载,在 160 tokens/秒/用户的交互目标下,其每兆瓦AI工厂吞吐量比GB300 NVL72最高提升 30 倍。NVIDIA将这一优势归因于Rubin GPU对大上下文处理和解码效率的优化,以及Vera CPU和相关网络架构的支持,但具体细节尚未完全披露。

GB300 NVL72的延续优势

NVIDIA将GB300 NVL72在AgentX上的优势描述为对前代产品的延续,其系统级优化包括MoE运行时(如SGLang、TensorRT-LLM、vLLM)的专家并行分配、DeepGEMM内核与混合精度格式(如MXFP4、MXFP8)的通信重叠,以及支持会话感知的动态路由。GB300 NVL72相比H200 NVL8的每百万token成本最多可降低 10 倍。

  • GB300 NVL72的可交互边界可扩展到约 215 tokens/秒/用户,这远超H200 NVL8的操作范围。
  • NVIDIA强调这些优势来自服务运行时、内核和NVLink扩展域的整体协同,而非单一组件。

信息来源