B200 · BLACKWELL GB100 · 特性专题
NVLink 5 · 1.8 TB/s 与 NVL72
★ Blackwell 互联主线 · 单卡双向 1.8TB/s · NVL72 把 72 颗 GPU 缝成单一 NVLink 域
是什么
DEFINITION第五代 NVLink:每卡 18 条链路 × 50 GB/s 单向 = 900 GB/s 单向 / 1.8 TB/s 双向,是 H200(900 GB/s 双向)的 2 倍[1]。配套第四代 NVLink Switch,在 GB200 NVL72 机柜里把 72 颗 GPU 连成单一 NVLink 域(任何两卡之间全带宽 all-to-all,聚合 130 TB/s),再经二级交换可扩到 576 GPU。
对写 kernel / 框架的人意义一句话:TP=8 的 all-reduce 不再是训练步时的隐形税,NVL72 还让 EP(专家并行)的 all-to-all 第一次有 NVLink 级延迟。
为什么(vs H200 NVLink4 / IB)
RATIONALE · COMPARISON| 维度 | H200 NVLink4 | B200 NVLink5 / NVL72 |
|---|---|---|
| 单卡双向带宽 | 900 GB/s(450/向) | 1.8 TB/s(900/向)[1] |
| 单域 GPU 数 | 8(HGX 基板)+ 2 级 64 | 72(NVL72)→ 二级 576 |
| 机柜聚合带宽 | — | 130 TB/s(NVL72)[1] |
| 对 GPU:总 I/O | 900 GB/s NVLink + 128 PCIe | 1.8 TB/s NVLink + 256 GB/s PCIe Gen6 |
| 跨机替代 | IB NDR 400G ≈ 50 GB/s/卡 | NVLink 900 GB/s/向——跨机柜仍需 IB/以太,差距 ~18× |
量级感:NVL72 里做一次 72 卡 FP8 all-reduce,通信量在 NVLink 域内消化;同样的事走 IB 要慢一个数量级以上。NVLink 解决 scale-up,IB/以太解决 scale-out——两层不要混着算账。
关键数字
KEY NUMBERS · BANDWIDTH BUDGET| 项 | 值 | 注 |
|---|---|---|
| 链路数 × 单向带宽 | 18 × 50 GB/s | 单向合计 900 GB/s |
| 双向带宽 | 1.8 TB/s[1] | 官方口径即双向 |
| NVL72 单域 | 72 GPU · 130 TB/s 聚合 | 18 台 NVSwitch 机柜 |
| 二级扩展 | 576 GPU | NVLink Switch 互联 |
| TP=8 all-reduce 时延量级 | ~2× 单向时延 + switch 跳数 | ring / tree 算法由 NCCL 选 |
| PCIe(host 侧) | Gen6 256 GB/s(GPU 能力) | HGX 系统实际到 host 为 Gen5 |
代码与账本
NCCL PATH · BANDWIDTH MATH① NCCL 自动走 NVLink 域
// NVL72 上 72 卡单 comm:NCCL 检测 NVSwitch 拓扑自动选 ring/tree
ncclCommInitRank(&comm, 72, devlist, rank);
ncclAllReduce(sendbuf, recvbuf, n, ncclBfloat16, ncclSum, comm, stream);
// TP=8 子集通信:用 ncclCommSplit 切子域,避免 72 卡大环
ncclCommSplit(comm, color_tp8, key_rank, &sub_comm, NULL, stream);
② 通信量速算(决定 TP/EP 选型)
# all-reduce 通信量 ≈ 2·N·(P-1)/P,P 卡 ring:
# 70B 模型 FP8 梯度 N=70e9 B:
bytes = 2 * 70e9 * (8-1)/8 # ≈ 122.5 GB per step
t_nvlink = bytes / 900e9 # ≈ 136 ms @单向900GB/s(算法分层后更低)
# 叠加 8TB/s HBM:B200 的通信:计算带宽比 = 1.8:8 = 1:4.4
# (H200 为 0.9:4.8 = 1:5.3——通信相对更充裕)
注意事项 / 陷阱
PITFALLS · CHECKLIST
CAUTION · 陷阱清单
- 1.8 TB/s 是双向口径:单向 900 GB/s;做通信时延估算时用单向值除通信量。
- NVL72 的 130 TB/s 是聚合带宽,不是点对点——两卡之间点对点仍受 900 GB/s/向限制。
- PCIe Gen6 只是 GPU 能力:HGX B200 系统到 host 实际跑 Gen5 x16(~128 GB/s)[1],CPU 侧数据通路别按 256 算。
- NCCL 大域(72 卡)默认算法不一定最优:小消息查 tree、大消息查 ring,用
NCCL_DEBUG=INFO确认所选算法与通道数。 - GB200 的 B200 是 1200W 口径(FP4 20 PF sparse);拿 NVL72 官方数推单卡性能时注意换算回 1000W 卡的 18 PF[1]。
- 跨机柜(>72 卡)通信回落 IB/以太——EP 大规模部署的 all-to-all 通信预算要按 scale-out 网络重新算。
数据源
SOURCES- NVIDIA Blackwell 架构页 + 技术白皮书(NVLink5 1.8TB/s / NVL72 / 576 扩展)
- GB200 NVL72 页(72 GPU 单域 / 130TB/s 聚合)
- DGX B200 页(单卡 NVLink / PCIe 官方口径)
- NCCL 文档(CommSplit / 拓扑检测 / 算法选择)