NVIDIA声称Spectrum-X以太网可将AI训练性能提升并抵御多租户干扰

NVIDIA技术博客发文,详述其Spectrum-X以太网架构如何针对大规模AI训练优化,声称相比传统以太网,在性能、故障恢复和多租户隔离方面均有显著提升。

AI解读:大规模AI训练需要成千上万块GPU高效协同,传统以太网处理这类同步流量时,极易因拥塞导致部分GPU空闲,拖慢整体训练。NVIDIA此次抛出的Spectrum-X以太网方案,核心是把网络控制从软件搬到硬件,让交换机、网卡能实时感知并绕开故障或拥堵链路。博客引用DeepSeek-V3模拟数据称,当有其他任务占用带宽时,传统以太网单步训练时间从0.735秒涨到1.18秒,而Spectrum-X始终稳定在0.668秒。文中还提到,遇到单条光纤故障时,Spectrum-X能硬件级在不到3毫秒内把流量切换到其余链路,甚至能保留75%的带宽。对正在建设或扩展AI集群的公司来说,如果该架构效果属实,意味着未来选择网络设备时,需要把故障恢复速度和多租户隔离能力纳入关键指标,而不是只比较带宽大小。不过,这次发布是NVIDIA的官方技术博客,数据多来源于其自身或合作方的模拟环境,效果还缺少大规模独立部署的第三方验证。对于多数普通企业,目前只需留意这一技术趋势,不必急于行动。

NVIDIA技术博客发布文章,介绍其面向AI数据中心设计的Spectrum-X以太网架构。文章称,该架构通过硬件加速的路由、拥塞控制与负载均衡,应对生成式AI大规模分布式训练对网络的特殊需求,并引用DeepSeek-V3训练模拟及多项基准测试,展示其相比传统以太网在性能、故障恢复和多租户隔离上的优势。

作者Elizabeth Goodman在文章中解释,传统以太网基于ECMP静态哈希路由,适合高熵的普通数据中心流量,但面对AI训练中低熵、大规模同步通信(如All-Reduce、All-Gather)时,容易出现哈希冲突、拥塞扩散和流量不均。此外,多租户环境下,相邻任务的流量可能干扰当前训练,导致All-to-All集合通信带宽下降超80%。

Spectrum-X以太网解决AI训练流量问题的三大机制

文章指出,Spectrum-X以太网通过三个硬件加速的控制回路来应对上述挑战:交换机内部的每包自适应路由(AR)、基于ECN标记的目标拥塞控制(CC),以及网卡(SuperNIC)中的平面负载均衡器(PLB)。

AR机制利用量化最短队列算法,每包动态选择拥塞最轻的端口,响应时间在数百纳秒级别。CC机制仅在自适应路由无法缓解端点拥塞时,通过ECN标记和RTT探测调整发送速率,避免对微突发流量过度反应。PLB则以每个目标GPU的每个物理平面为单位维护拥塞状态,发送前过滤掉拥塞或故障的平面,再从剩余健康平面中选择本地队列最短的那个,将流量平均分摊到多个网路平面上。

传统以太网在AI工作负载下的性能局限

技术博客用DeepSeek-V3训练模拟来展示传统以太网在多租户场景下的弱点。模拟中,当没有背景噪声流量时,标准以太网单步训练时间为735毫秒;加入噪声后,该时间膨胀至1.18秒,相当于1.6倍减速。相比之下,Spectrum-X以太网在类似条件下,无论有无噪声,单步训练时间均稳定在668毫秒。

此外,在RDMA bisection基准测试中,NVIDIA称传统以太网因静态ECMP路由哈希冲突,部分GPU对的吞吐量降至25 Gbps,而Spectrum-X以太网能维持所有GPU对98%的线速;75%负载下,传统以太网P99尾延迟达22微秒,Spectrum-X维持在8至9微秒。

Multiplane拓扑与PLB的故障恢复能力

为了扩展到数十万GPU,现代AI数据中心常采用Multiplane拓扑,将单个NIC的800 Gbps带宽切分为多个200 Gbps的独立平面,构建浅层二层胖树结构。文章称,传统方法(如纯随机报文喷洒)在平面出现物理故障或链路抖动时表现不佳,因为流量仍会均衡加载到已降级的平面,导致整体性能被拖累。

Spectrum-X的PLB硬件在SuperNIC内实现状态化的两阶段选择,能够隔离故障平面。文中举例说,多层网络中若某一平面出现20%的交换机间连接故障,传统以太网的所有平面都会降至80%容量,而Spectrum-X能动态绕开故障区域,使其余健康平面保持100%容量,最终All-to-All带宽高1.2倍。

在链路抖动恢复测试中,传统以太网软件负载均衡器需要约1.08秒才能恢复,而Spectrum-X的硬件PLB只需2.68毫秒,相差约400倍。对于单条光纤故障(如某平面容量减半),PLB能在3毫秒内将流量重新映射到剩余健康平面,保留可用带宽的75%。

在部分网络故障下的性能表现

文章强调,传统以太网在10%的叶上行链路失效时,由于路由不对称,集合通信带宽可能崩溃超过50%;而Spectrum-X以太网据称在10%链路故障下,带宽仅按比例降低11%,尾延迟仅增加7%,确保训练性能与物理连接损失成比例。这种能力有助于在基础设施未完全修复时,仍能高效运行训练任务,减少停机时间。

查看原图 · 1920 × 1080
查看原图 · 1920 × 1080
查看原图 · 1536 × 864
查看原图 · 1024 × 576
查看原图 · 960 × 540
查看原图 · 1627 × 967
查看原图 · 1847 × 851
查看原图 · 1722 × 865
查看原图 · 1773 × 887

信息来源