MetaRoCE:为 AI 规模以太网打造的全新 RDMA 传输协议
MetaRoCE: A New RDMA Transport Built for AI-Scale Ethernet
Meta 设计并开源了 MetaRoCE,一个专为 AI 工作负载在通用以太网上打造的 RDMA 传输协议,已通过 Open Compute Project(OCP)发布规范、参考软件实现和合规测试套件。该协议将智能移至端点,原生支持乱序交付、多路径、无损容忍和双向拥塞控制,无需 PFC,可在百万 GPU 规模下提供高吞吐、低尾延迟。现有 RDMA Verbs API 和软件栈无需修改即可运行。
MetaRoCE 把拥塞控制与路径选择交给端点,AI 集群无需 PFC 也能在有损以太网上维持吞吐,实测 1% 丢包下保持 86% 吞吐,为大规模组网去掉无损约束提供了依据。
- 训练和部署前沿 AI 模型,依赖于快速、可靠的网络,这些网络需要在 GPU 之间传输数据,而不浪费计算周期。
- 为了大规模应对这一挑战,Meta 设计了 MetaRoCE——一种从零开始构建的 RDMA 传输协议,专为在通用以太网上运行 AI 工作负载而打造。
- 我们通过 Open Compute Project(OCP)发布 MetaRoCE 规范、参考软件实现和合规测试套件,以使更广泛的行业能够采用、实现并在此基础上继续构建。
在 Meta,我们一直是行业日益增长的共识背后的有力推动者,即以太网应当成为 AI 基础设施的首选网络架构。我们已经展示了 RoCE 能够支撑大规模的分布式 AI 训练。现在,我们在这项工作的基础上推出 MetaRoCE,这是一种从底层开始、专为百万 GPU 规模的以太网而设计的协议。
我们已经扩展了数十万 GPU 规模的集群,这些集群分布在多个数据中心和区域。无论这些集群是在训练下一代前沿模型,还是在全球范围内提供推理服务,网络都处于关键路径之上。
在训练过程中,all-reduce 和 all-to-all 这类集合通信操作会同步数千个加速器,而最慢的传输决定了整个任务的节奏。在推理中,分布式模型分片之间的低延迟通信直接影响着数亿用户的响应时间。即便是少量的网络摩擦,也会直接导致大量计算能力被闲置。
标准 RoCE 期望网络按序交付每一个帧,依赖 PFC,并抑制数据包喷洒——而后者恰恰是在多平面和大规模网络中提供性能的关键。MetaRoCE 的设计目标,是在加速器数量与彼此间距离不断增长的情况下,依然提供高吞吐、低尾延迟和运维简便性。
MetaRoCE 的工作原理
MetaRoCE 的核心洞见很简单:网络结构看到的是数据包,而 NIC 看到的是意图。传统架构将智能集中在网络结构中,依赖交换机来强制实现无损和维持顺序。
通过将智能转移到端点,MetaRoCE 把网络分解为许多细粒度的逻辑路径,每条路径都有自己的实时遥测数据——每条路径的 RTT、ECN 状态和利用率。这种可见性解锁了传统 RDMA 难以实现的能力。

原生乱序交付
MetaRoCE 将数据包喷洒到多条路径上,因此它们按设计就是乱序到达的。该传输层将乱序到达视为正常情况。每个数据包都携带自己的目的地,因此数据在落地时直接写入其最终内存位置,无需重排序缓冲区,也没有队头阻塞。
每次 Write 都在每个数据包中携带目的地。Send 则将匹配信息投递到已发布的接收缓冲区,因此即使它前面的消息尚未到达,Send 也能正确落地,而且无需往返来了解数据去向。集合通信库可以在适合的地方使用双边消息传递,而不必把一切都简化为 Write。

原生多路径
MetaRoCE 为每条连接提供一等路径,并逐包在这些路径上进行喷洒。每条路径携带一个不同的 UDP 源端口作为其 ECMP 熵,NIC 可以随时更改该端口,以将流量从故障路由上移开。在多平面网络中,平面选择完全交由 NIC 负责,网络被利用的程度完全取决于 NIC 喷洒的效果。由于每条路径都维护自己的窗口和往返时延估计,传输层能够区分拥塞与故障并进行显式再平衡,因此一条过热或中断的链路只会拖慢一条路径,而不会让整条连接停滞。
设计上的丢包容忍
MetaRoCE 将以太网网络视为有损的,并不要求它变成无损——没有 PFC,没有暂停帧。由于每条路径都携带自己的有序序列,其 256 位选择性确认位向量中的空缺就是丢包的证据,而非乱序的证据。在其他协议中,SACK 主要用于避免重传已经到达的数据;而在这里,一旦出现空缺,它就会立即触发在丢失该包的那条路径上精确重传那个缺失的包。
双向拥塞控制
MetaRoCE 将传统的基于 ECN、由发送端驱动的 AIMD 拥塞控制与接收端驱动的公平份额速率提示相结合。窗口既按连接维护,也按路径维护,因此一个拥塞标记会削减看到该标记的那条路径的发送量,并将后续数据包引导至畅通的路径。在每一个确认中,接收端都会返回它分配给该发送端的入站带宽份额,因此发送端可以直接逼近正确的速率,而无需自行搜索。Incast 可在一到两个往返内解决,同时具备更好的公平性和更低的尾部延迟。

拓扑无关性
MetaRoCE 只向网络架构要求两样每个交换机都已具备的能力:ECN 标记和 ECMP。它不需要数据包裁剪、带内遥测、基于信用的流控或交换机侧喷洒,而当网络架构提供这些能力时它也不会失效。同一套传输协议可运行在 fat-tree、多平面、深缓冲和浅缓冲网络架构之上,也可运行在你无法控制其配置的厂商云上。其中不涉及任何专有技术,因此网络架构可以自由地针对成本和布线进行优化。
规模化下的统一连接
一个队列对(QP)同时承载一条有序的消息流和带宽。传统 RDMA 要获得更多的消息流或带宽,就得打开更多的 QP(每对节点之间数十个),每个 QP 都有对其余 QP 一无所知的拥塞窗口,并在网卡上拥有各自的状态。
MetaRoCE 将两者分离。单个连接在上层承载许多相互独立的有序流,每个通信器或集合操作一条,并在下层承载许多路径,统一归一个拥塞控制器管理。连接状态不再随工作负载的并行度而增长。
应用层基本保持不变——现有的 RDMA Verbs API 和软件栈无需修改即可运行。多平面支持等增强功能通过扩展 API 提供。
Meta-RoCE 实践
为加速硬件验证,我们与 AMD 合作,在其 Pensando 可编程网卡上实现了 MetaRoCE。
在一个运行 RCCL 集合通信的 64 节点 AMD GPU 集群上,我们在 all-reduce 和 all-to-all 操作中直接对比了 MetaRoCE 与 RoCEv2。结果与设计目标一致:

相比 RoCEv2,MetaRoCE 始终能够提供更高的吞吐量和更低的流完成时间。
在会导致 RoCEv2 性能下降的丢包条件下,MetaRoCE 在 1% 丢包率时仍保持约 86% 的吞吐量,即使在 10% 的极端丢包率下也能继续提供有效带宽——优雅收敛而非崩溃。
在最多 4,000 个并发连接的 4 平面和 8 平面拓扑中进行的多平面验证确认,吞吐量随平面数量线性扩展。
在模拟平面故障期间,该协议展现出优雅的自主恢复能力——流量重新分配,无需应用参与或运维人员干预。
这些结果印证了 MetaRoCE 的核心设计选择。通过从第一天起就为丢包而设计,并将智能推向边缘,你得到的传输方案不仅在理想条件下表现更优,而且在出问题时也能优雅降级。
开放设计
AI 基础设施受益于共享标准,这些标准能加速整个生态系统的创新。MetaRoCE 将 Open Compute Project(OCP)的 Ethernet Scalable Unified Network(ESUN)计划为网络架构所确立的同一套开放、多厂商理念,延伸到了传输层。
正因如此,我们开放 MetaRoCE:
通过 OCP 开放规范:完整协议规范正在贡献给 OCP,任何厂商均可实现并构建可互操作的硬件。
多种 NIC 实现:MetaRoCE 被设计为可运行于多种 NIC 架构之上——无论是可编程的还是固定功能的。我们已在 AMD Pensando 硬件上验证了它,其他厂商的更多实现也在进行中。
生产合规套件:我们开发了一套合规套件,为硬件厂商提供工具,以证明其实现符合协议规范。
软件参考实现:我们的 libsoftmetaroce 库提供了一个完整、可运行的传输协议栈,可在通用 Linux 上通过标准 UDP socket 运行,无需专用硬件。它既是芯片开发的权威行为模型,也是我们统一合规框架的基础。
前路展望
借助 MetaRoCE,我们在横向扩展网络方面取得了重大进展——在通用以太网上实现了数据中心内高性能、高韧性的传输。但 AI 基础设施横跨多种距离与延迟区间,每个区间都带来了我们正在积极应对的不同挑战:
纵向扩展(Scale-up):在单个机架内,加速器之间交换的是小消息,每一纳秒都至关重要。MetaRoCE 消除了两个主要的延迟来源——重排序缓冲区和 PFC。我们目前正在优化快速信令路径,以支持从一个处理单元直接发往另一个处理单元的短内存操作。
跨域扩展(Scale-across):跨域扩展使单个作业能够跨越相距数千公里的多栋建筑。往返延迟拉长至毫秒级,而路径之间的微小差异会不断累积。将路径视为一等实体,正是 MetaRoCE 得以自适应、优先选择不拥塞路径并在每一层级追求公平性的关键。接下来的工作在于公平地共享存在争用的长距离链路。
存储/KV-cache 用例:分布式存储会引发 incast,即单次读取扇出到多台服务器,而它们同时回复。接收方驱动的速率提示让接收数据的一方(接收写入的存储服务器或接收读取的客户端)来调节入站速率,无论请求是发往十台服务器还是一千台。新的难点在于,在网络速度各异、请求大小不一的情况下,如何保持该速率的准确性。
帮助我们构建面向 AI 基础设施的以太网未来
10 月,我们将在 2026 OCP 全球峰会上发布 MetaRoCE 规范、一个针对 DPDK 优化的软件参考实现,以及我们的生产合规框架。
我们以开放方式构建这一切,因为未来的挑战有赖于广泛的行业协作。如果你正在构建 NIC、交换机或 AI 基础设施,我们邀请你加入我们。
来源:Meta Engineering Blog(RSS) · engineering.fb.com