NVIDIA · BLACKWELL ULTRA · GB300 NVL72 · 机柜级
GB300NVL72 · 机柜速查
面向 CUDA 算子 / 框架工程师的机柜级数字 · 倍数均相对 9×HGX H200(对齐 72 GPU)
整机柜总账
RACK TOTALS · 72-GPU ALIGNED · DENSE 口径同一件事的两种形态:72 颗 GPU 摊在约 5 个风冷机柜(9 × HGX H200 节点 + IB/以太 spine),或收进 1 个全液冷 NVLink 单域柜。GB200 NVL72 参照列用于看「同代柜级 Ultra 增量」。
| 指标 | GB300 NVL72 · 单柜 | 9× HGX H200 | ×倍数 (dense) | GB200 NVL72 参照 | 直觉注解 |
|---|---|---|---|---|---|
| 计算资源 | |||||
| 发布年份 | 2025.3(GTC25) | 2023.11(SC23) | — | 2024.3(GTC24) | NVL72 两代柜仅隔 1 年;GB300 2025 H2 交付 |
| GPU | 72 × B300 Ultra(双 die 4NP · 208B) | 72 × H200(GH100 · 4N · 80B) | 数量对齐 | 72 × B200 | 倍数里不含规模差,只含代差[1] |
| CPU | 36 × Grace · 2,592 Arm 核(NVLink-C2C) | 18 × Xeon 8480C · 1,008 核(PCIe) | — | 36 × Grace | 超芯片合一 vs GPU/CPU 分离 |
| ★ FP4 TC dense | 1,080 PF | — | H200 无 FP4 | 720 PF | 官方 dense 标注值;vs H200 最快档(FP8)×7.6[1] |
| FP8 TC dense | 360 PF | 142.5 PF | ×2.53 | 360 PF | FP8 两代 Blackwell 持平——Ultra 只加 FP4 档[1] |
| BF16 TC dense | 180 PF | 71.3 PF | ×2.53 | 180 PF | BF16 训练集群换代的线性收益 |
| TF32 TC dense | 90 PF | 35.6 PF | ×2.53 | 90 PF | 非 TC 精度同判:×2.5 一档 |
| INT8 TC dense | 12 POPS | 142.5 POPS | ×0.08 | — | 官方页口径与 FP8 关系反常(B200 世代 INT8≈FP8),INT8 重负载慎选 Ultra[7] |
| FP64 TC | 100 TF | 4.82 PF | ×0.02 | — | HPC 反向倒退 ×48——FP64 密集负载 H200 完胜[1] |
| 存储 | |||||
| HBM 总容量 | 20 TB HBM3e | 10.15 TB HBM3e | ×1.97 | 13.5 TB | 每 GPU 288GB(12-Hi)vs 141 vs 186[4] |
| HBM 聚合带宽 | 576 TB/s | 345.6 TB/s | ×1.67 | 576 TB/s | 每 GPU 8TB/s 不变:容量涨、带宽平[6] |
| CPU 侧内存 | 17 TB LPDDR5X @ 14 TB/s | ~18 TB DDR5 @ ~6.4 TB/s推算 | — | 17 TB @ 14 TB/s | Grace 内存经 NVLink-C2C 可被 GPU 直接访问[1] |
| 规模 · 域 · 功率 | |||||
| ★ NVLink 域 | 72 GPU · 1 个域 | 8 GPU × 9 个域 | 9 域 → 1 域 | 72 GPU · 1 个域 | 本页核心叙事:TP/EP 的物理边界从节点变成机柜[2] |
| 机柜占用 | 1 柜 · 液冷 · ~1.6 t | ~5 柜 · 风冷 8U×9 + spine推算 | — | 1 柜 | 2 节点/柜为行业惯例配置[3] |
| GPU TGP 合计 | 100.8 kW(72×1,400W) | 50.4 kW(72×700W) | ×2.0 | 86.4 kW(72×1,200W) | 单卡 TGP 翻倍是密度跃升的根源[4] |
| 整组功率 | 最高 142 kW(OEM 标称 132–135) | ~92 kW + 网络(9×10.2 kW) | ×1.5 | ~120 kW第三方 | 换算成每柜密度:~135 vs ~23 kW/柜[2] |
① 每 GPU ×2.5 是线性部分:FP8/BF16/TF32 全部 ×2.53,容量 ×2、带宽 ×1.67——9 柌换 1 柜的「选型账」按这个乘。② 质变在域不在量:9 个 8-GPU 岛 → 1 个 72-GPU 单域,通信/并行策略的物理边界重画(§3–§4)。③ FP4 是唯一新增档位:1,080 PF dense 只有 NVFP4 路径吃得到,vs H200 最快的 FP8 档 ×7.6——但要求权重+激活全 4-bit 化(见 B200 页 NVFP4 专题)。
单 GPU 锚点
PER-GPU ANCHOR · B300 ULTRA vs H200 SXM总账的倍数全部由单卡差值线性放大而来。刻度 0–4×;微架构(tcgen05 / TMEM / NVFP4 指令集)细节见 B200 页,此处只留选型级数字。
| 指标 | B300 Ultra | H200 SXM | 相对 H200 · 刻度 0–4× | 直觉注解 |
|---|---|---|---|---|
| 架构 / 工艺 | Blackwell Ultra · 双 die 4NP · 208B | Hopper · GH100 · 4N · 80B | 跨两代微架构 | Ultra 与 B200 同 die 血统微调[4] |
| SM 数量 | 148(74/die)第三方 | 132 | ×1.12 | 同 B200;官方未文档化 |
| HBM 容量 | 288 GB HBM3e(12-Hi) | 141 GB HBM3e | ×2.04 | Ultra 主打:容量 +50% vs B200 的 186GB[4] |
| HBM 带宽 | 8 TB/s | 4.8 TB/s | ×1.67 | 8TB/s 与 B200 持平——Ultra 没加带宽[6] |
| NVLink | 1.8 TB/s 双向 · 18 links(五代) | 900 GB/s 双向 · 18 links(四代) | ×2.00 | 域大小才是质变:8 → 72 |
| ★ FP4 TC dense | 15 PF | — | 新精度 | 每时钟 NVFP4 ×1.5 vs B200;softmax 吞吐 ×2(SFU)[6] |
| FP8 TC dense | 5 PF | ~1.98 PF | ×2.53 | FP8 档 Ultra 零增益(vs B200 持平)[1] |
| BF16 TC dense | 2.5 PF | 0.99 PF | ×2.53 | 未上 4-bit 的训练负载就吃这档 |
| FP64 TC | ~1.4 TF | 67 TF | ×0.02 | 柜级 100 TF 由 72×1.39 反推[7] |
| TGP | 1,400 W | 700 W(max 805W) | ×2.00 | 液冷是 1,400W 的前提[4] |
| scale-out NIC | ConnectX-8 · 800 Gb/s/GPU | CX-7 400G ×8/节点(~50 GB/s/GPU) | ×2 | 柜间/集群网:Quantum-X800 / Spectrum-X[1] |
| Compute Capability | 10.0(sm_100) | 9.0(sm_90) | tcgen05 / TMEM / NVFP4 门槛 | kernel 侧迁移指南见 B200 页 |
互联拓扑对比
FABRIC TOPOLOGY · 9 DOMAINS → 1 DOMAINFIG. 03 — 9×HGX H200(9 域 + SPINE) vs GB300 NVL72(单域全对全)
| 拓扑要素 | GB300 NVL72 | 9× HGX H200 | 直觉注解 |
|---|---|---|---|
| scale-up 结构 | 18 计算托盘 + 9 交换托盘(2 NVSwitch/托盘) | 9 × 节点内 NVSwitch 底板 | NVL72 把 NVSwitch 从底板抬到机柜中板[2] |
| 每 GPU NVLink | 18 links · 1.8 TB/s 双向 | 18 links · 900 GB/s 双向 | 链路数同、速率 ×2;每 link 400Gbps[1] |
| 域内归约 | NVSwitch in-switch 归约(NVLS/SHARP) | 节点内 NVLS · 节点间 IB SHARP | 归约发生在交换 ASIC 内,免 GPU 回传[5] |
| 跨域/柜 | CX-8 800G/GPU → Quantum-X800 / Spectrum-X | 8×400G/节点 → IB / 以太 spine | 跨柜实测衰减见 §4 通信账本 |
通信账本
COMM LEDGER · MEASURED BUSBW × 容量账对框架工程师,NVL72 的本质变化是通信账重写:all-reduce 带宽 ×2 且覆盖全域、跨节点悬崖消失。实测来自 CoreWeave(NCCL 2.26.2,GB200 NVL72——GB300 同 NVLink5 拓扑)[5]。
| 通路 | NVL72(实测/官方) | 9× HGX H200 | ×倍数 | 直觉注解 |
|---|---|---|---|---|
| NVLink 每 GPU 双向 | 1,800 GB/s | 900 GB/s(仅节点内 8 卡) | ×2 | H200 出节点即失效;NVL72 全域有效[1] |
| ★ all-reduce busbw · 域内 | ~745 avg · 峰 ~840 GB/s第三方 | ~370 · 峰 480 GB/s(域=8)第三方 | ×2 · 域 8→72 | 72 卡实测:吞吐不随域变大而掉[5] |
| ★ all-reduce busbw · 跨节点/柜 | 2 柜 ~688 · 20 柜 ~298 GB/s第三方 | ~50 GB/s 上限推算 | ×14(2 柜) | H200 跨节点 8×400G 是硬顶;NVL 跨柜走 CX-8[5] |
| scale-out NIC | 800 Gb/s/GPU(CX-8) | 400 Gb/s/GPU(CX-7 ×8/节点) | ×2 | 柜间 fat-tree 的每 GPU 上行 |
| 小消息 P2P 延迟 | 2 GPU ~9 µs · 4 GPU ~22 µs第三方 | — | — | NCCL 2.27 symmetric memory(B200 系实测)[5] |
H200 集群的通信策略本质是「把通信锁进 8 卡节点,跨节点忍 50 GB/s」;NVL72 上这条悬崖挪到了柜间——72 卡之内没有跨节点概念,TP/EP/PP 重排的逻辑随之改变(见 §6)。
NCCL 侧速记 · 单域 comm + symmetric memory
// NVL72:一个 communicator 覆盖全部 72 GPU(单 NVLink 域)
ncclCommInitRank(&comm, 72, devlist, rank);
// NCCL 2.27+ symmetric memory:降小消息延迟(2 GPU ~9µs)
ncclCommRegister(comm, buf, size);
// all-reduce 走 NVSwitch in-switch 归约(NVLS),免 GPU 中转
ncclAllReduce(buf, buf, n, ncclBfloat16, ncclSum, comm, stream);
H200 集群上常见的「节点内 NVLS comm + 节点间 IB comm」两级结构,在 NVL72 内退化为单 comm;跨柜才需要第二级(CX-8 800G)。
DeepSeek-R1 671B · FP8 权重 ≈ 0.7 TB → 单柜 EP 单域全驻留,剩余 ~19 TB 全给 KV cache / batch;万亿参数级 FP8 ≈ 1–1.8 TB 同样单柜装下。9×HGX H200 总容量 10.15 TB 并不小,但分属 9 个 8-GPU 域——TP>8 或大 EP 必须跨 IB。切换 NVFP4 后权重再减半,MoE dispatch 流量同步减半[6]。
机房与供电
FACILITY · POWER / COOLING / FOOTPRINT算力翻 2.5 倍的代价先落在机房:全液冷、~135 kW/柜密度、DC 母排供电。硬件量给到推算级,不含购机/租赁价格。
| 维度 | GB300 NVL72 | 9× HGX H200 | 直觉注解 |
|---|---|---|---|
| 冷却 | 全液冷 MGX · 托盘+机柜两级漏液检测 | 8U 风冷节点(液冷背门可选) | 风冷机房必须改水管/CDU[2] |
| 整组功率 | 最高 142 kW · OEM 标称 132–135 kW | ~92 kW 服务器 + 网络(9×10.2 kW) | ×1.5 功率换 ×2.53 算力[2] |
| 功率密度 | ~135 kW/柜 | ~20–25 kW/风冷柜(2 节点/柜) | 密度 ×6:单柜电路/散热全重做 |
| 供电架构 | 8 × 33 kW 电源架(各 6×5.5 kW PSU)· ~54V DC 母排 | 200–240 VAC · 机柜 PDU | 800VDC 是 Kyber/Vera Rubin 代际路线,本代未上[2] |
| 占地 / 承重 | 1 柜 · ~1.6 t第三方 | ~5 柜(8U×9 + spine)推算 | 占地 ×1/5;楼板承重需复核 |
| 年耗电(PUE 1.3) | ~1,600 MWh推算 | ~1,160 MWh推算 | 142 kW×8760h×1.3;H200 含网络 ~102 kW |
| 每 PF·FP8d 年电 | ~4.5 MWh推算 | ~8.1 MWh推算 | 每 FLOP 能效 ×1.8——电费单看是赚的 |
① 供水与 CDU:液冷回路/漏液响应接入监控;② 供电容量:单柜 142 kW 峰值 + 电源架冗余(8×33 kW 母排);③ 承重:~1.6 t/柜 + 冷液重量;④ 网络侧:CX-8 800G 上行对应 Quantum-X800/Spectrum-X spine 重规划。风冷机房不改这三样,NVL72 进不去——这是「9 柜 H200 → 1 柜 NVL72」切换的真实成本所在。
迁移注意
MIGRATION NOTES · WHAT CHANGES FOR YOU① 头条 1,440 PF 两代同数:GB200 与 GB300 的 sparse FP4 都是 1,440 PF——Ultra 的增量全在 dense 档(720→1,080),跨代对比必须同口径。② 每 GPU 带宽 8TB/s 不变:纯带宽受限负载(embedding lookup、长 context decode、小 GEMM)不因换代变快,Ultra 收益 = 容量 + FP4 算力 + softmax ×2。③ 总量 ×2.5 是线性,质变在域:8→72 的单域重画 TP/EP 边界,这才是重写并行策略的理由。
| 项 | H200 集群习惯 | NVL72 上 | 直觉注解 |
|---|---|---|---|
| TP 档位 | 8(锁死在节点内) | 8 / 16 / 36 / 72 单域可选 | 72 = 2²×3²,整除档位多;大模型 TP 可出节点不断带宽 |
| EP · MoE | 专家跨节点走 IB all-to-all | 域内 130 TB/s all-to-all | 256 专家 / 72 域除不尽 → pad 或 TP×EP 混合 |
| NCCL | 节点内 + 节点间两级 comm | 单 comm ×72 · symmetric memory 需 2.27+ | 小消息延迟 ~9 µs 级;跨柜再起第二级 |
| 精度 | FP8 主力 | NVFP4 权重+激活 · dispatch 流量减半 | 量化校准与精度回归必须重跑(见 B200 页专题) |
| 调度单元 | 以节点(8 GPU)为单元 | 以 NVL 域(72 GPU)为单元 | 作业按 72 倍数分片;柜间 800G CX-8 是新的「跨节点」 |