NVIDIA称Vera CPU可提升AI智能体任务性能达1.5倍,针对高变异性工作负载优化
NVIDIA发布技术文章,基于16万余次智能体会话遥测数据,称其Vera CPU在智能体任务上性能可达竞品AMD Venice的1.5倍。
AI解读:AI智能体(如Claude Code)的运行模式与传统计算不同:它们大部分时间在跑一条漫长的串行推理链,工具调用和子任务并发只是偶尔出现的短促爆发。NVIDIA从163,594次真实会话中统计发现,超过97%的会话轨迹独一无二,说明这种工作负载极难预测,因此用多款不同型号的CPU来拼凑机群并不划算。NVIDIA的答案是推出一款单一且均衡的Vera CPU:用奥林巴斯(Olympus)核心同时兼顾串行路径所需的单线程性能和并发爆发所需的线程数。根据内部估算,在编译器、静态分析、Python等典型智能体基准测试中,Vera CPU的每核心性能是AMD Venice(基于SPECrate 2026整数基分2070估算)的1.5倍。这里的关键数字是1.5倍对比,而不是绝对速度,且基分和归一化方式均有NVIDIA内部推算成分。对运行大模型智能体服务的团队而言,这条新闻提示你在选购或扩容CPU机群时,应优先看完成会话总数而非单纯核心数,若你的负载主要是串行推理链,则低主频高核心数可能不是最优解。普通读者不需要立即行动,因为这是厂商的早期性能声明,尚无第三方实测数据,正式SPEC结果与真实部署表现可能不同。
NVIDIA于8月11日发表技术博客,介绍其Vera CPU如何针对AI智能体工作负载进行优化。文中引用来自163,594次智能体会话的遥测数据,其中超过97%的会话轨迹为唯一模式,表明智能体任务高度多变,难以靠多种专用CPU设计来适配。NVIDIA称,Vera CPU的奥林巴斯(Olympus)核心在满负载下仍能保持强单线程性能,并为并行爆发提供并发支持。NVIDIA估计,Vera CPU在智能体工作负载上的性能可达最新竞品AMD Venice的1.5倍。
博客指出,智能体工作负载的形状由“长度”(推理步骤、工具调用、重试等)和“宽度”(每阶段并发数量)刻画。遥测显示,真实会话中主智能体大部分时间沿长串行轨迹推进(例如一次33分钟的Claude Code会话),即便出现并行子任务爆发,端到端耗时仍受串行链路主导。因此,针对智能体CPU机群的优化目标应是完成的用户会话总数,而非核心数。
NVIDIA表示,为提升单线程性能而临时关闭核心可能浪费内存资源:每关闭一个核心,可能闲置8 GB内存,导致高达1.5 TB的内存容量被闲置(按典型系统推算)。Vera CPU的均衡设计旨在避免此类资源浪费。
遥测揭示智能体轨迹特性
NVIDIA这篇由Michelle Horton撰写的博客,将AI工厂比作相互连接的系统,其机群经济性取决于整个技术栈将电力与资本转化为完成智能体任务的速度。CPU负责编排、工具执行和沙箱计算,而GPU负责运行模型。与传统计算中稳定的运行特征不同,智能体工作负载具有高度可变性。
为说明这种可变性,博客引用了来自163,594次智能体会话的遥测数据:超过97%的会话具有唯一的轨迹轮廓(图1)。这使按多个专用CPU设计点来精确匹配机群规模不切实际。
该遥测还揭示,这些多样轨迹在执行中表现为长串行推理链,间或出现短暂的并行爆发(即扇出)。NVIDIA认为,主导的串行路径严格受延迟约束——决定整体会话完成时间,而临时扇出则要求线程并发和每线程低延迟并存。因此,AI工厂需要的是单一均衡的CPU设计点。
- 智能体轨迹的“长度”:完成一轮会话前所需的推理步骤、工具调用、重试和子任务数量。
- 智能体轨迹的“宽度”:每个阶段并发工作的并行程度,如并发工具调用、检索操作、沙箱或子智能体。
- 即使会话具有可观宽度,大部分墙钟时间仍可能花费在等待串行链上,因为并行爆发是暂时的,而底层依赖链持续存在。
Vera CPU设计点与1.5倍性能估计
NVIDIA称其Vera CPU基于奥林巴斯(Olympus)核心构建,旨在全芯片活跃时仍维持强单线程性能。其宽前端、先进分支预测、深度乱序执行和高带宽内存子系统,帮助每个核心在大型代码足迹、分支密集型控制流、动态运行时和依赖密集型执行下保持前进。
为验证设计,NVIDIA援引了内部估计的SPEC CPU® 2026结果(图5),覆盖编译器、静态分析和Python基准等典型智能体工作负载。该公司称,Vera CPU在智能体性能上可比最新竞品高出1.5倍,具体对照AMD Venice。NVIDIA在文中给出Venice估算法:基于SPECrate®2026_int_base 2070分,并依据内部Turin测量做组件归一化,强调“结果或有差异”。
NVIDIA的结论是,Vera CPU为实现整个智能体轨迹而设计,而非针对单一阶段:强单线程性能加上足够并发和内存带宽,可有效利用核心、DRAM、GPU HBM及更广内存层级,从而最大化完成用户轮次并改善AI工厂输出与经济性。
文中还提到Vera CPU的低延迟单片架构可减少拓扑引起的停顿和延迟波动,降低将机群划分给多个专用CPU设计点的必要性。
- 1.5倍性能为NVIDIA内部估计,基于其自身SPEC CPU 2026测量(2026年7月),并非独立的第三方SPEC结果。
- AMD Venice的个体工作负载性能是估算值(SPECrate 2026整数基分2070),实际结果可能因配置而异。
- NVIDIA表示,单个Vera CPU设计点即可满足不可预测的工具调用模式,无需细分机群。