GB300NVL72 RACK REFQR-300

NVIDIA · BLACKWELL ULTRA · GB300 NVL72 · 机柜级

GB300NVL72 · 机柜速查

面向 CUDA 算子 / 框架工程师的机柜级数字 · 倍数均相对 9×HGX H200(对齐 72 GPU)

MAIN READOUT · 柜级主读数 DISP · 01
FP4 算力 · DENSE 单柜 1,080PFLOPS SPARSE 1,440 · H200 无 FP4[1]
FP8 算力 · DENSE 单柜 360PFLOPS ×2.53 vs 9×HGX H200 的 142.5 PF[1]
HBM3E 总容量 · 单柜 20TB ×2.0 · 每 GPU 288GB · 另 17TB LPDDR[1]
HBM 聚合带宽 · 单柜 576TB/s ×1.67 · 每 GPU 8TB/s 两代 Blackwell 不变[6]
NVLINK 域 · 单柜 72 GPU 130TB/s 全对全单域 · H200 域=8[1]
ALL-REDUCE 实测 BUSBW ~745GB/s CoreWeave 实测 · H200 节点内 ~370[5]
RDY · 口径 对齐 72 GPU(1×NVL72 vs 9×HGX H200) · DENSE=SPARSE÷2(官方规则) · 实测/推算逐行分级标注
SCALE 1:1 · 72× B300 ULTRA · 20 TB HBM3E · ≤142 KW
01

整机柜总账

RACK TOTALS · 72-GPU ALIGNED · DENSE 口径

同一件事的两种形态:72 颗 GPU 摊在约 5 个风冷机柜(9 × HGX H200 节点 + IB/以太 spine),或收进 1 个全液冷 NVLink 单域柜。GB200 NVL72 参照列用于看「同代柜级 Ultra 增量」。

指标GB300 NVL72 · 单柜9× HGX H200×倍数 (dense)GB200 NVL72 参照直觉注解
计算资源
发布年份2025.3(GTC25)2023.11(SC23)2024.3(GTC24)NVL72 两代柜仅隔 1 年;GB300 2025 H2 交付
GPU72 × B300 Ultra(双 die 4NP · 208B)72 × H200(GH100 · 4N · 80B)数量对齐72 × B200倍数里不含规模差,只含代差[1]
CPU36 × Grace · 2,592 Arm 核(NVLink-C2C)18 × Xeon 8480C · 1,008 核(PCIe)36 × Grace超芯片合一 vs GPU/CPU 分离
FP4 TC dense1,080 PFH200 无 FP4720 PF官方 dense 标注值;vs H200 最快档(FP8)×7.6[1]
FP8 TC dense360 PF142.5 PF×2.53360 PFFP8 两代 Blackwell 持平——Ultra 只加 FP4 档[1]
BF16 TC dense180 PF71.3 PF×2.53180 PFBF16 训练集群换代的线性收益
TF32 TC dense90 PF35.6 PF×2.5390 PF非 TC 精度同判:×2.5 一档
INT8 TC dense12 POPS142.5 POPS×0.08官方页口径与 FP8 关系反常(B200 世代 INT8≈FP8),INT8 重负载慎选 Ultra[7]
FP64 TC100 TF4.82 PF×0.02HPC 反向倒退 ×48——FP64 密集负载 H200 完胜[1]
存储
HBM 总容量20 TB HBM3e10.15 TB HBM3e×1.9713.5 TB每 GPU 288GB(12-Hi)vs 141 vs 186[4]
HBM 聚合带宽576 TB/s345.6 TB/s×1.67576 TB/s每 GPU 8TB/s 不变:容量涨、带宽平[6]
CPU 侧内存17 TB LPDDR5X @ 14 TB/s~18 TB DDR5 @ ~6.4 TB/s推算17 TB @ 14 TB/sGrace 内存经 NVLink-C2C 可被 GPU 直接访问[1]
规模 · 域 · 功率
NVLink 域72 GPU · 1 个域8 GPU × 9 个域9 域 → 1 域72 GPU · 1 个域本页核心叙事:TP/EP 的物理边界从节点变成机柜[2]
机柜占用1 柜 · 液冷 · ~1.6 t~5 柜 · 风冷 8U×9 + spine推算1 柜2 节点/柜为行业惯例配置[3]
GPU TGP 合计100.8 kW(72×1,400W)50.4 kW(72×700W)×2.086.4 kW(72×1,200W)单卡 TGP 翻倍是密度跃升的根源[4]
整组功率最高 142 kW(OEM 标称 132–135)~92 kW + 网络(9×10.2 kW)×1.5~120 kW第三方换算成每柜密度:~135 vs ~23 kW/柜[2]
NOTE · 总账三条读法

① 每 GPU ×2.5 是线性部分:FP8/BF16/TF32 全部 ×2.53,容量 ×2、带宽 ×1.67——9 柌换 1 柜的「选型账」按这个乘。② 质变在域不在量:9 个 8-GPU 岛 → 1 个 72-GPU 单域,通信/并行策略的物理边界重画(§3–§4)。③ FP4 是唯一新增档位:1,080 PF dense 只有 NVFP4 路径吃得到,vs H200 最快的 FP8 档 ×7.6——但要求权重+激活全 4-bit 化(见 B200 页 NVFP4 专题)。

02

单 GPU 锚点

PER-GPU ANCHOR · B300 ULTRA vs H200 SXM

总账的倍数全部由单卡差值线性放大而来。刻度 0–4×;微架构(tcgen05 / TMEM / NVFP4 指令集)细节见 B200 页,此处只留选型级数字。

指标B300 UltraH200 SXM相对 H200 · 刻度 0–4×直觉注解
架构 / 工艺Blackwell Ultra · 双 die 4NP · 208BHopper · GH100 · 4N · 80B跨两代微架构Ultra 与 B200 同 die 血统微调[4]
SM 数量148(74/die)第三方132×1.12同 B200;官方未文档化
HBM 容量288 GB HBM3e(12-Hi)141 GB HBM3e×2.04Ultra 主打:容量 +50% vs B200 的 186GB[4]
HBM 带宽8 TB/s4.8 TB/s×1.678TB/s 与 B200 持平——Ultra 没加带宽[6]
NVLink1.8 TB/s 双向 · 18 links(五代)900 GB/s 双向 · 18 links(四代)×2.00域大小才是质变:8 → 72
FP4 TC dense15 PF新精度每时钟 NVFP4 ×1.5 vs B200;softmax 吞吐 ×2(SFU)[6]
FP8 TC dense5 PF~1.98 PF×2.53FP8 档 Ultra 零增益(vs B200 持平)[1]
BF16 TC dense2.5 PF0.99 PF×2.53未上 4-bit 的训练负载就吃这档
FP64 TC~1.4 TF67 TF×0.02柜级 100 TF 由 72×1.39 反推[7]
TGP1,400 W700 W(max 805W)×2.00液冷是 1,400W 的前提[4]
scale-out NICConnectX-8 · 800 Gb/s/GPUCX-7 400G ×8/节点(~50 GB/s/GPU)×2柜间/集群网:Quantum-X800 / Spectrum-X[1]
Compute Capability10.0(sm_100)9.0(sm_90)tcgen05 / TMEM / NVFP4 门槛kernel 侧迁移指南见 B200 页
03

互联拓扑对比

FABRIC TOPOLOGY · 9 DOMAINS → 1 DOMAIN
FIG. 03 · 机柜互联拓扑示意
上一代 · 9 × HGX H200 — 9 个 8-GPU 域 IB / 以太 Spine · scale-out 每节点 8×400G · ~50 GB/s/GPU(推算) HGX H200 ×9HGX H200HGX H200 HGX H200HGX H200HGX H200 HGX H200HGX H200HGX H200 8× GPU + NVSwitch8× GPU + NVSwitch8× GPU + NVSwitch 8× GPU + NVSwitch8× GPU + NVSwitch8× GPU + NVSwitch 8× GPU + NVSwitch8× GPU + NVSwitch8× GPU + NVSwitch 域 = 8域 = 8域 = 8 域 = 8域 = 8域 = 8 域 = 8域 = 8域 = 8 节点内 NVLink4 900 GB/s/GPU · 节点间走 spine(带宽降一个量级) 风冷 8U ×9 · 常见 2 节点/柜 ≈ 5 柜 域合并 9 → 1 GB300 NVL72 — 单柜 · 1 个 72-GPU 域 计算托盘 ×18(示意 6) 4× B300 + 2× Grace2× CX-8 + BF-3 4× B300 + 2× Grace2× CX-8 + BF-3 4× B300 + 2× Grace2× CX-8 + BF-3 4× B300 + 2× Grace2× CX-8 + BF-3 4× B300 + 2× Grace2× CX-8 + BF-3 4× B300 + 2× Grace2× CX-8 + BF-3 NVLink5 交换托盘 ×9(示意 3) 2× NVSwitchNVOS · in-switch 归约 2× NVSwitchNVOS · in-switch 归约 2× NVSwitchNVOS · in-switch 归约 每 GPU 18 links → 全对全 scale-out:72 × ConnectX-8 800G → Quantum-X800 / Spectrum-X(跨柜/集群) 单 NVLink 域 · 130 TB/s 全对全 · 72 GPU 表现如 1 颗 全液冷 MGX · 18 计算托盘 + 9 交换托盘(18 NVSwitch ASIC)
计算节点 / 托盘 NVLink5 交换层(域合并的关键) scale-out 网络(IB / 以太) NVLink 全对全 / 上行链路

FIG. 03 — 9×HGX H200(9 域 + SPINE) vs GB300 NVL72(单域全对全)

拓扑要素GB300 NVL729× HGX H200直觉注解
scale-up 结构18 计算托盘 + 9 交换托盘(2 NVSwitch/托盘)9 × 节点内 NVSwitch 底板NVL72 把 NVSwitch 从底板抬到机柜中板[2]
每 GPU NVLink18 links · 1.8 TB/s 双向18 links · 900 GB/s 双向链路数同、速率 ×2;每 link 400Gbps[1]
域内归约NVSwitch in-switch 归约(NVLS/SHARP)节点内 NVLS · 节点间 IB SHARP归约发生在交换 ASIC 内,免 GPU 回传[5]
跨域/柜CX-8 800G/GPU → Quantum-X800 / Spectrum-X8×400G/节点 → IB / 以太 spine跨柜实测衰减见 §4 通信账本
04

通信账本

COMM LEDGER · MEASURED BUSBW × 容量账

对框架工程师,NVL72 的本质变化是通信账重写:all-reduce 带宽 ×2 且覆盖全域、跨节点悬崖消失。实测来自 CoreWeave(NCCL 2.26.2,GB200 NVL72——GB300 同 NVLink5 拓扑)[5]

通路NVL72(实测/官方)9× HGX H200×倍数直觉注解
NVLink 每 GPU 双向1,800 GB/s900 GB/s(仅节点内 8 卡)×2H200 出节点即失效;NVL72 全域有效[1]
all-reduce busbw · 域内~745 avg · 峰 ~840 GB/s第三方~370 · 峰 480 GB/s(域=8)第三方×2 · 域 8→7272 卡实测:吞吐不随域变大而掉[5]
all-reduce busbw · 跨节点/柜2 柜 ~688 · 20 柜 ~298 GB/s第三方~50 GB/s 上限推算×14(2 柜)H200 跨节点 8×400G 是硬顶;NVL 跨柜走 CX-8[5]
scale-out NIC800 Gb/s/GPU(CX-8)400 Gb/s/GPU(CX-7 ×8/节点)×2柜间 fat-tree 的每 GPU 上行
小消息 P2P 延迟2 GPU ~9 µs · 4 GPU ~22 µs第三方NCCL 2.27 symmetric memory(B200 系实测)[5]
CAUTION · 通信悬崖对比(大消息 all-reduce)
NVL72 域内 ~745
×1 · 72 卡全域
H200 节点内 ~370
×0.5 · 仅 8 卡
NVL72 跨 20 柜 ~298
×0.4 · 千卡级仍可用
H200 跨节点 ~50
×1/15 ≈ 一次 NVL72

H200 集群的通信策略本质是「把通信锁进 8 卡节点,跨节点忍 50 GB/s」;NVL72 上这条悬崖挪到了柜间——72 卡之内没有跨节点概念,TP/EP/PP 重排的逻辑随之改变(见 §6)。

NCCL 侧速记 · 单域 comm + symmetric memory
// NVL72:一个 communicator 覆盖全部 72 GPU(单 NVLink 域)
ncclCommInitRank(&comm, 72, devlist, rank);
// NCCL 2.27+ symmetric memory:降小消息延迟(2 GPU ~9µs)
ncclCommRegister(comm, buf, size);
// all-reduce 走 NVSwitch in-switch 归约(NVLS),免 GPU 中转
ncclAllReduce(buf, buf, n, ncclBfloat16, ncclSum, comm, stream);

H200 集群上常见的「节点内 NVLS comm + 节点间 IB comm」两级结构,在 NVL72 内退化为单 comm;跨柜才需要第二级(CX-8 800G)。

NOTE · 容量账:20 TB 单域能装下什么
权重体积 [TB] ≈ 参数量(B) × 每参数字节 ÷ 1000 · FP8=1B · NVFP4≈0.5B

DeepSeek-R1 671B · FP8 权重 ≈ 0.7 TB → 单柜 EP 单域全驻留,剩余 ~19 TB 全给 KV cache / batch;万亿参数级 FP8 ≈ 1–1.8 TB 同样单柜装下。9×HGX H200 总容量 10.15 TB 并不小,但分属 9 个 8-GPU 域——TP>8 或大 EP 必须跨 IB。切换 NVFP4 后权重再减半,MoE dispatch 流量同步减半[6]

NOTE · 第三方实测锚点(口径注意)

SGLang / InferenceXv2(DeepSeek R1):GB300 NVL72 vs H200 最高 25×——但这是 50 TPS/user 交互约束下的口径;去掉延迟约束,H200 堆吞吐能接近很多[6]。读数规则:低延迟在线服务的收益 ≫ 离线批处理。NVIDIA 官方「vs Hopper 35× 成本/token、50×/MW」为营销口径,仅作脚注不入表[6]

05

机房与供电

FACILITY · POWER / COOLING / FOOTPRINT

算力翻 2.5 倍的代价先落在机房:全液冷、~135 kW/柜密度、DC 母排供电。硬件量给到推算级,不含购机/租赁价格。

维度GB300 NVL729× HGX H200直觉注解
冷却全液冷 MGX · 托盘+机柜两级漏液检测8U 风冷节点(液冷背门可选)风冷机房必须改水管/CDU[2]
整组功率最高 142 kW · OEM 标称 132–135 kW~92 kW 服务器 + 网络(9×10.2 kW)×1.5 功率换 ×2.53 算力[2]
功率密度~135 kW/柜~20–25 kW/风冷柜(2 节点/柜)密度 ×6:单柜电路/散热全重做
供电架构8 × 33 kW 电源架(各 6×5.5 kW PSU)· ~54V DC 母排200–240 VAC · 机柜 PDU800VDC 是 Kyber/Vera Rubin 代际路线,本代未上[2]
占地 / 承重1 柜 · ~1.6 t第三方~5 柜(8U×9 + spine)推算占地 ×1/5;楼板承重需复核
年耗电(PUE 1.3)~1,600 MWh推算~1,160 MWh推算142 kW×8760h×1.3;H200 含网络 ~102 kW
每 PF·FP8d 年电~4.5 MWh推算~8.1 MWh推算每 FLOP 能效 ×1.8——电费单看是赚的
NOTE · 机房改造清单(上线前核对)

① 供水与 CDU:液冷回路/漏液响应接入监控;② 供电容量:单柜 142 kW 峰值 + 电源架冗余(8×33 kW 母排);③ 承重:~1.6 t/柜 + 冷液重量;④ 网络侧:CX-8 800G 上行对应 Quantum-X800/Spectrum-X spine 重规划。风冷机房不改这三样,NVL72 进不去——这是「9 柜 H200 → 1 柜 NVL72」切换的真实成本所在。

06

迁移注意

MIGRATION NOTES · WHAT CHANGES FOR YOU
CAUTION · 三条口径红线

① 头条 1,440 PF 两代同数:GB200 与 GB300 的 sparse FP4 都是 1,440 PF——Ultra 的增量全在 dense 档(720→1,080),跨代对比必须同口径。② 每 GPU 带宽 8TB/s 不变:纯带宽受限负载(embedding lookup、长 context decode、小 GEMM)不因换代变快,Ultra 收益 = 容量 + FP4 算力 + softmax ×2。③ 总量 ×2.5 是线性,质变在域:8→72 的单域重画 TP/EP 边界,这才是重写并行策略的理由。

H200 集群习惯NVL72 上直觉注解
TP 档位8(锁死在节点内)8 / 16 / 36 / 72 单域可选72 = 2²×3²,整除档位多;大模型 TP 可出节点不断带宽
EP · MoE专家跨节点走 IB all-to-all域内 130 TB/s all-to-all256 专家 / 72 域除不尽 → pad 或 TP×EP 混合
NCCL节点内 + 节点间两级 comm单 comm ×72 · symmetric memory 需 2.27+小消息延迟 ~9 µs 级;跨柜再起第二级
精度FP8 主力NVFP4 权重+激活 · dispatch 流量减半量化校准与精度回归必须重跑(见 B200 页专题)
调度单元以节点(8 GPU)为单元以 NVL 域(72 GPU)为单元作业按 72 倍数分片;柜间 800G CX-8 是新的「跨节点」
AUXRESERVED · Vera Rubin NVL144 预留对比位