CARD · 卡片档案

MetaRoCE:为 AI 规模以太网从零设计的 RDMA 传输协议(规范开源)

Meta 为 GPU 集群训练与推理设计了全新 RDMA 传输协议 MetaRoCE:把拥塞控制与路径选择移到端点,原生支持乱序交付、多路径与有损以太网容忍,不依赖 PFC,号称在百万 GPU 规模仍保持高吞吐低尾延迟。规范、参考实现与合规测试套件已通过 Open Compute Project 开放。

01
THE STORY · 原文与要点

读懂内容,再看适用边界。

  • 原文出处媒体报道https://engineering.fb.com/2026/08/24/networking-traffic/metaroce-rdma-transport-ai-ethernet

为什么值得了解

网络正成为大规模训练的显性瓶颈;一份不依赖 PFC 的开放规范给自建推理/训练集群提供了可对标的新基线。

适用条件与限制

性能结论全部来自 Meta 自家博客与集群环境,不是独立复测;engineering.fb.com 在大陆访问受限,已附 AIHOT 中文摘要链接作可达阅读路径。规范的实际跨厂商兼容性尚待 OCP 生态验证。

本次阅读进度保存在当前浏览器。 收藏或写笔记 →

02
THE THREAD · 完整时间线

1 条事件,逐条可溯。

同一张卡在不同阶段会被补充记录:新佐证进入、市场出现对比、原文发生实质变化——每条都带日期,链接到当天归档页。

卡片时间线
  1. 本站收录进入 BitShovel 雷达:AIHOT 精选 收录时可见 37 条。

03
SOURCES · 来源与依据

按链接核对用途与边界。

来源与依据 · 2 条链接

逐条说明链接的用途与支持范围。链接数量不代表多方独立验证,“直接支持”也仅限下方写明的内容。

发现错误或使用问题?纠错与反馈 ↗