L1.2 节点内与跨节点互联拓扑
三维坐标
layer: L1(计算与编排)|level: Senior|pillar: 硬件架构上一篇我们把单卡内部(HBM、SM、Tensor Core)讲透了。本文把视角拉到多卡与多机:当一个模型大到单卡装不下、单机训不动时,GPU 之间怎么连、机器之间怎么连,就直接决定了你的 All-Reduce 跑多快、千卡集群的扩展效率(scaling efficiency)能不能守住。这是「通信墙」从理论走向工程的第一现场。
学习目标
- 前置知识:读过 L0 全层(尤其 L0.2 三大物理墙,知道「通信墙」与 scaling efficiency 的概念);读过 L1.1 单卡微架构(知道单卡内部 HBM/SM/Tensor Core,理解「单卡装不下就要切多卡」的动机);知道 All-Reduce 是分布式训练里的梯度同步操作即可,无需 NCCL/RDMA 实战经验。
- 学完产出:① 能画出单节点 8 卡的 NVSwitch 全连接拓扑,并说清它相比 PCIe 树形「为什么 8 卡能近线性扩展」;② 能用「单卡双向带宽」这把尺子,排出 PCIe / NVLink 各代 / HCCS / UALink 的数量级梯队,并指出 scale-up 带宽每代翻倍的趋势;③ 能讲清 RDMA「绕内核、绕 CPU、零拷贝」的本质,并对比 InfiniBand 与 RoCE v2 在「无损语义靠谁兜底」上的根本分野;④ 能解释 PFC(硬刹车)与 ECN/DCQCN(软刹车)各自的作用与风险,说清「为什么千卡 RoCE 集群的生死线是拥塞控制」;⑤ 亲手用 nccl-tests(或 CPU 上 gloo)跑通一次 All-Reduce,量化「节点内 NVLink 带宽 vs 跨节点带宽」近 20 倍的木桶落差。
- 阅读姿势:盯住一条主线——「互联拓扑的一切设计,都是为了把那块最短的『跨节点带宽』木桶板尽量补高」。无论是节点内拼带宽密度(NVLink/NVSwitch),还是节点间拼无损与规模(IB/RoCE + 拥塞控制),本质都在和同一堵「通信墙」搏斗:算力按卡数线性涨,通信开销却超线性膨胀。
背景与现状
大模型训练的本质是一场 「算力 × 通信」的协同战争。当你把一个模型切到 N 张卡上(数据并行 DP / 张 量并行 TP / 流水并行 PP),每个训练 step 结束都要做一次 梯度同步(All-Reduce) 或激活交换。这一步不产生任何 FLOPS,却必须等所有卡的数据搬运完成——它就是分布式训练里那块最短的木桶板。
互联拓扑要解决的核心矛盾是:计算能力按卡数线性增长,但通信开销随规模超线性膨胀。于是整个产业沿两条战线演进:
- 节点内(scale-up,纵向扩展):让一台机器里的 8 张卡像「一张大卡」。代表是 NVIDIA 的 NVLink / NVSwitch,H100 时代单卡双向带宽已达 ~900 GB/s,到 Blackwell 的 NVLink 5 提升到 ~1.8 TB/s,Rubin 规划的 NVLink 6 再翻倍(~3.6 TB/s 级),远超 PCIe Gen5 的 ~128 GB/s。华为昇腾用 HCCS 走同一思路。值得注意的是,2025 年起出现了 scale-up 互联的开放阵营:NVIDIA 推出 NVLink Fusion(Computex 2025,把 NVLink 开放给第三方 CPU/ASIC),而 AMD、Google、Intel、Broadcom 等联合推动 UALink 1.0(2025 年 4 月发布规范,200 GT/s/lane,最多连 1024 个加速器)对标 NVLink。
- 节点间(scale-out,横向扩展):让成百上千台机器组成集群。代表是 InfiniBand(IB) 与跑在以太网上的 RoCE v2,靠 RDMA(远程直接内存访问) 绕过内核做零拷贝传输,单端口从 NDR 400 Gb/s 升级到 XDR 800 Gb/s(Quantum-X800 平台,随 Blackwell 部署),下一代 GDR 1.6 Tb/s 在路上。以太网侧,Ultra Ethernet Consortium(UEC)于 2025 年 6 月发布 1.0 规范,专为 AI/HPC 重构以太网传输(包级负载均衡、改进拥塞控制),2026 年进入产品落地早期。
业界信号(截至 2026 年中):scale-up 的边界被一路推到机柜级——GB200/GB300 NVL72 用第五代 NVSwitch 把 72 颗 Blackwell GPU 连成「~130 TB/s 全互联域」,对外像一台超级 GPU;华为 CloudMatrix CM384 用光互联把 384 颗昇腾 910C 连成超节点对标 NVL72;NVIDIA 规划的 Vera Rubin NVL144(2026 H2)则把这一逻辑再推进一代。与此同时,互联从「单厂封闭」走向「开放标准之争」:NVLink Fusion vs UALink、InfiniBand vs Ultra Ethernet,正是 2025–2026 数据中心网络最关键的两条战线。
一句话定位:节点内拼带宽密度,节点间拼无损与规模,而两者的带宽鸿沟(900 GB/s vs 50 GB/s,差近 20 倍),就是后文所有拓扑设计与拥塞控制的根源动机。
原理与架构
2.1 节点内:NVLink / NVSwitch 全连接与带宽演进
PCIe 是「总线 + 树形」结构,多卡共享带宽、且必须经 CPU 中转,做 8 卡 All-Reduce 时会严重抢占。NVLink 则是 GPU 之间的点对点高速私链,NVSwitch 进一步把它做成一颗交换芯片,让节点内任意两卡都享有全互联、非阻塞的对等带宽。
带宽演进与横向对比(单卡双向聚合带宽):
| 互联方案 | 代际 / 平台 | 单卡双向带宽 | 关键特征 |
|---|---|---|---|
| PCIe Gen5 ×16 | 通用 | ~128 GB/s | 共享总线、经 CPU、做基线 |
| NVLink 3.0 | A100 | ~600 GB/s | 12 条 link × 50 GB/s |
| NVLink 4.0 | H100 | ~900 GB/s | 18 条 link,配 NVSwitch3 |
| NVLink 5.0 | B200 / GB200 / GB300 (Blackwell) | ~1.8 TB/s | NVL72 机柜级全互联 ~130 TB/s |
| NVLink 6.0(路线图) | Rubin VR200 (2026 H2) | ~3.6 TB/s 级 | 随 Rubin 推出,带宽较 NVLink 5 翻倍 |
| 开放标准 UALink 1.0 | 多厂(AMD/Google/Intel 等) | 200 GT/s per lane | 2025 规范发布,对标 NVLink 的开放 scale-up |
| 昇腾 HCCS | 昇腾 910B/910C | ~392 GB/s 起(节点内) | 华为自研,CM384 用光互联做超节点级 scale-up |
需要强调的是:NVSwitch 的价值不只是「快」,而是让 8 卡的 All-Reduce 拓扑无关——无论 Ring 还是 Tree 算法,任意卡对都有满带宽对等链路,避免了 PCIe 树形结构里的「热点链路」。这正是单机 8 卡能近乎线性扩展的硬件底座。
2.2 跨节点:InfiniBand vs RoCE v2 协议栈
跨节点的关键技术是 RDMA(Remote Direct Memory Access):网卡(NIC)直接读写远端主机内存,绕过操作系统内核、绕过 CPU、零拷贝(zero-copy),把端到端延迟压到微秒级。配合 GPUDirect RDMA,数据更能从本地 GPU 显存直达远端 GPU 显存,全程不经 CPU 内存中转。
RDMA 有两条工程路线,差异全在「靠什么承载无损语义」:
| 维度 | InfiniBand (XDR) | RoCE v2 / Ultra Ethernet |
|---|---|---|
| 物理网络 | 专用 IB 交换机/线缆(Quantum-X800) | 标准以太网交换机(Spectrum-X 等) |
| 单端口带宽 | 800 Gb/s(XDR),1.6T(GDR)在路上 | 400 / 800 Gb/s(取决于网卡/交换机) |
| 无损保证 | 链路层原生信用流控,天生无损 | 依赖 PFC + ECN;UEC 1.0(2025.06)改进拥塞控制与包级负载均衡 |
| 上手与运维 | 开箱无损、调参少,但生态封闭、贵 | 复用以太网生态、便宜,但调不好就丢包雪崩 |
| 典型场景 | 大厂超算/万卡训练首选 | 成本敏感、已有以太网基建;UEC 推动以太网逐步追平无损能力 |
核心在于:IB 把「无损」做在了协议栈底层硬件里,RoCE v2 则把无损责任上移到了运维——它本质是「在会丢包的以太网上,用 PFC/ECN 拼出一个不丢包的假象」。这就是 2.3 节拥塞控制成为千卡 RoCE 集群「生死线」的原因。
2.3 拥塞控制:PFC / ECN 为何是千卡集群的生死线
RDMA 的 GBN(Go-Back-N) 重传机制对丢包极其敏感:一旦丢一个包,可能要回退重传整批,吞吐断崖式下跌。所以跨节点网络必须无损(lossless)。RoCE v2 用两件武器拼出无损:
- PFC(Priority Flow Control,优先级流控,L2 逆压):当交换机某队列快满时,向上游发 PAUSE 帧,让上游「先别发了」。这是硬刹车——快、但会逆压传播,处理不当引发 PFC 风暴 / 死锁(deadlock),让整片网络停摆。
- ECN(Explicit Congestion Notification,显式拥塞通知,L3 端到端):交换机检测到拥塞苗头时,不丢包,而是给 IP 包打标记;接收端把标记回传给发送端,发送端主动降速(DCQCN 算法)。这是软刹车——更平滑,是主力调速手段。
木桶效应:节点内 NVLink ~900 GB/s,跨节点 IB/RoCE 单端口仅 ~50 GB/s——相差近 20 倍。当 All-Reduce 跨越节点边界时,整个集合通信的有效带宽被最慢的跨节点链路钳制,这就是「跨节点带宽是 All-Reduce 的木桶板」。因此工程上要做两件事:① 用 Rail-optimized 拓扑 + 每卡独享网卡,让跨节点流量并行铺开;② 死守 PFC/ECN 不丢包,因为千卡规模下哪怕 0.01% 丢包率都会让重传开销吞掉扩展效率。NCCL 的
NCCL_ALGO(Ring/Tree)与NCCL_IB_*参数,本质都是在围绕这条木桶板做优化。