Meta发布MetaRoCE:为百万GPU级以太网设计的全新RDMA传输协议
Meta宣布将MetaRoCE规范、软件参考实现和合规测试套件贡献给开放计算项目(OCP),该协议专为AI工作负载设计,支持数据包乱序到达、多路径传输和丢失容忍。
AI解读:Meta正在重写RDMA(远程直接内存访问)传输协议,以解决AI集群中网络成为瓶颈的问题。在传统RoCE下,网络必须按顺序交付每个数据包,严重依赖PFC流控,一旦发生拥塞或丢包,训练速度就会被最慢的传输拖累。MetaRoCE的核心变化是把智能从交换机移到网卡(NIC)上:数据包被分散到多条路径传输,乱序到达成为常态,每个数据包自带目的地信息,无需重排缓冲区;同时它不要求网络无损,允许一定丢包,并通过每路径的确认和精确重传来恢复。测试显示,在 1% 丢包率下仍能保持约 86% 的吞吐量,而传统RoCEv2在这种条件下会显著退化。对构建或使用大规模AI基础设施的团队而言,这意味着网络不再需要昂贵的无损交换机或专有硬件——Meta的规范和支持软件将通过OCP开放,任何厂商都能实现。协议设计目标是在理想条件下性能更好,在故障时优雅降级,而不是彻底崩溃。
Meta于 2026 年 8 月 24 日发布MetaRoCE,一个为AI工作负载设计的全新RDMA传输协议,并宣布将其规范、软件参考实现和合规测试套件贡献给开放计算项目(OCP)。该协议针对基于通用以太网的百万GPU级集群,目标是提高吞吐量、降低尾延迟并简化运维。
协议设计:将智能移至端点,适应有损以太网
Meta表示,传统RoCE依赖网络按顺序交付每个帧,使用PFC(优先级流控)并抑制数据包喷射,这在多平面和大规模网络中限制了性能。MetaRoCE则把智能从交换机集中式架构移到端点(NIC),将网络分解为多条细粒度逻辑路径,每条路径有独立的实时遥测(RTT、ECN状态、利用率)。
协议原生支持乱序交付:数据包被喷射到多条路径,乱序到达被视作正常情况。每个数据包携带自身目的地,数据落地时直接写入最终内存位置,无需重排缓冲区,避免了队头阻塞。发送操作携带对已发布接收缓冲区的匹配信息,即使前面的消息未到达,也能正确落地。
MetaRoCE使用每条路径独立的UDP源端口作为ECMP熵,网卡可随时更换路径以避开故障路由。传输层将网络视为有损,不使用PFC或暂停帧。每条路径有自己的顺序号,256 位选择性确认位图中的间隙被解释为丢失而非乱序,从而精确重传丢失的数据包。
拥塞控制结合了基于ECN的发送端AIMD和接收端公平速率提示。窗口按路径和连接维护,接收方在每个确认中返回分配给该发送方的入站带宽份额,使发送方直接接近正确速率。协议仅需交换机已有的ECN标记和ECMP功能,不要求包修剪、网络内遥测或交换机侧喷射,可运行在fat-tree、多平面等多种拓扑上,包括不受控制的云环境。
测试结果:对比RoCEv2与多平面验证
Meta与AMD合作,在Pensando可编程网卡上实现了MetaRoCE,并在一个 64 节点AMD GPU集群(运行RCCL集合通信)上与RoCEv2进行了all-reduce和all-to-all操作对比。Meta称结果与设计目标一致:MetaRoCE持续提供比RoCEv2更高的吞吐量和更低的流完成时间。
在会导致RoCEv2性能下降的数据包丢失条件下,MetaRoCE在 1% 丢包率时保持约 86% 的吞吐量,在 10% 的极端丢包率下仍能提供有效带宽,表现为优雅降级而非崩溃。多平面验证覆盖 4 平面和 8 平面拓扑、多达 4000 个并发连接,确认吞吐量随平面数线性扩展;模拟平面故障时,协议能自主恢复,流量重新分配无需应用或操作员干预。
Meta将MetaRoCE定位为开放标准,延续了OCP的以太网可扩展统一网络(ESUN)倡议的开源理念。公司计划在 2026 年 10 月的OCP全球峰会上发布协议规范、基于DPDK优化的软件参考实现以及生产合规框架。参考实现libsoftmetaroce可在标准Linux UDP套接字上运行,无需专用硬件,作为硅片开发的行为模型。
后续方向:机架内、跨建筑与存储场景
Meta表示正在推进三个后续方向:Scale-up(机架内短消息低延迟优化)、Scale-across(支持跨数千公里建筑的单任务,路径公平性共享是关键),以及存储/KV-cache用例(通过接收端速率提示应对incast场景)。这些内容属于Meta的路线图声明,尚未提供详细实现或测试数据。