跳到主要内容

GB300 Grace Blackwell Ultra 全解:从 20 PFLOPS 桌面超算到数据中心旗舰

· 阅读需 6 分钟
Industry Research Team

同一颗 GB300 Grace Blackwell Ultra 芯片,既能撑起 350 万美元级的数据中心机柜,也能塞进一台放在办公桌上的 DGX Station。2026 年 10 月微软活动上预览的 DGX Station for Windows,让这个"双面故事"变得更加完整。本文依据站内芯片数据库,梳理 GB300 在 Blackwell 家族中的定位、桌面与数据中心的产品分层,以及 WSL 桥接对 Windows 企业市场的意义。

GB300 在 Blackwell 家族中的定位​

GB300 是 NVIDIA 第三代 Grace Blackwell 超级芯片,2025 H2 发布。其代际演进脉络清晰:

指标GH200 (2023-Q3)GB200 (2024-Q4)GB300 (2025 H2)
GPUH100B200B300 Ultra
CPUGrace 72 核Grace 72 核Grace 72 核
GPU 内存96GB HBM3192GB HBM3e288GB HBM3e
GPU 带宽3.35 TB/s8 TB/s10 TB/s
NVLink 域内60 TB/s130 TB/s130 TB/s
网络ConnectX-7 400GConnectX-8 800GConnectX-9 1.6T
FP4 sparse(单 GPU)N/A(FP8 2 PF)10 PF15 PF
TDP(GPU)1000W1000W1400W

GB300 超级芯片 = 2 颗 B300 Ultra GPU + 1 颗 Arm Grace CPU(72 核 Neoverse V2),通过 900 GB/s 的 NV-HBI 高速接口配对。据站内芯片数据库,单 Superchip FP4 sparse 算力 30 PFLOPS、FP8 dense 7.5 PFLOPS、GPU 侧总显存 576GB HBM3e,Superchip 模块单价约 7-8 万美元。

B300 Ultra:288GB HBM3e 的推理特化​

B300 Ultra(Blackwell Ultra)是 Blackwell 的中期升级版本,2026 年 1 月正式出货。据站内芯片数据库:

  • 显存:288GB HBM3e(12-Hi 堆叠),相比 B200 的 192GB 提升 50%,可单卡加载 FP16 的 70B 模型并保留 100GB+ 给 KV Cache;
  • 算力:FP4 稀疏 30 PFLOPS、FP8 密集 7 PFLOPS,相比 B200 均提升约 56%;
  • 实测:DeepSeek-R1 Prefill 吞吐 22,476 TGS,相比 H200 提升 8 倍;短输出场景提升 20 倍。

需要说明的是,站内 b300-ultra 卡按单卡口径记录 FP4 稀疏 30 PFLOPS,而 gb300 卡的代际对比表按单 GPU 口径记 15 PFLOPS(Superchip 两颗合计 30 PFLOPS),两个数据源口径存在差异,读者引用时需注意区分。B300 的制程仍为台积电 4NP,升级重心放在显存容量与 FP4 精度上——这正是"中期升级"的典型特征:架构不动,围绕推理经济性做增量。

NVL72 机柜:数据中心旗舰形态​

36 颗 GB300 组成 NVL72 机柜(72 颗 B300 Ultra + 36 颗 Grace),据站内芯片数据库:

项目配置
HBM 总量20.7 TB HBM3e
LPDDR5X 总量34.6 TB
NVLink 5 域内130 TB/s 全互联
ConnectX-9 出口72× 1.6T = 115 Tb/s
FP4 sparse 总算力1.08 EFLOPS
机柜 TDP约 120kW(含冷却)
价格约 330 万美元/机柜

ConnectX-9 是这代机柜的隐性升级:单端口 1.6 Tb/s 相比 ConnectX-8 翻倍,延迟低于 0.5 微秒,支持 NVLink over IB 跨机柜互联。8 个机柜可组成 NVL576 域——576 颗 B300 Ultra 共享 130 TB/s 互联,是业界最大单一 NVLink 域,对万亿参数 LLM 训练至关重要。云端租用方面,行业口径(Nebius)B300 的租用价格约为 9.50 美元/GPU 小时,站内芯片数据库另记录 AWS 8 卡 B300 实例(p6-b200.48xlarge)单 GPU 小时价 11.70 美元,不同供应商价差明显。

在 token 成本维度,站内数据给出了关键洞察:B300 单价虽高,但以 Llama 70B 推理测算,FP4 量化下单 token 成本相比 H100 低约 61%——单价高不等于用得贵。

DGX Station:20 PFLOPS 的桌面超算​

2026 年 10 月的微软活动上,NVIDIA 预览了 DGX Station for Windows,核心配置:

  • 芯片:GB300 Grace Blackwell Ultra Desktop Superchip;
  • 一致性内存:748GB(252GB HBM3e + 496GB LPDDR5X);
  • 算力:最高 20 PFLOPS FP4;
  • 模型能力:可在本地运行约 1 万亿参数模型;
  • 软件:Linux 工具链经 WSL(Windows Subsystem for Linux)访问;
  • 上市:2026 Q4,ASUS、Dell、HP、Lenovo 推出整机。

产品分层:1 PFLOPS 与 20 PFLOPS 之间​

DGX Station 的出现补全了 NVIDIA 桌面产品线的断层。站内芯片数据库记录的 RTX Spark(RTX DGX Spark)定位约 1 PFLOPS 级 FP4 算力的紧凑桌面开发机,而基于 GB300 Desktop Superchip 的 DGX Station 直接把桌面算力抬到 20 PFLOPS——20 倍的分层差距,对应着完全不同的用户画像:

维度RTX SparkDGX Station (GB300)
算力约 1 PFLOPS FP4最高 20 PFLOPS FP4
内存统一紧凑内存748GB 一致性内存
目标场景个人开发、微调小型模型本地万亿参数推理、企业级开发
价格量级消费级/准专业级高端工作站

WSL 桥接:Windows 企业市场的钥匙​

DGX Station for Windows 最值得玩味的细节是"Linux 工具链经 WSL 访问"。CUDA 生态的主场在 Linux,此前企业若要在 Windows 环境做本地 AI 开发,往往需要双机或虚拟化方案。WSL 桥接意味着:

  1. 企业 IT 无需改变管理习惯:Windows 域、组策略、合规审计体系原样保留;
  2. 开发者无需迁移工作流:PyTorch、TensorRT-LLM 等工具链在 WSL 内原生运行;
  3. 数据不出本地:金融、医疗、政务等对数据合规敏感的行业,获得了一条"本地跑万亿参数模型"的合规路径。

这与 GB300 数据中心侧的统一内存设计一脉相承:Grace 上 480GB LPDDR5X 与 B300 上 288GB HBM3e 统一寻址,CPU 与 GPU 共享一致性内存池。桌面版把同样的架构哲学浓缩进一台工作站——数据搬运越少,推理经济性越好。

小结​

GB300 家族展示了 NVIDIA 的典型打法:一颗芯片,从数据中心机柜到桌面工作站全栈铺开。数据中心侧,B300 Ultra 用 288GB HBM3e 和 FP4 精度把推理 token 成本压到 H100 的四成以下;桌面侧,DGX Station 用 20 PFLOPS FP4 和 748GB 一致性内存把"本地大模型"从口号变成 Q4 可买的产品。而 Rubin R200 已在 H2 2026 接棒数据中心旗舰,GB300 的价值窗口正在收窄——但它建立的"统一内存 + 桌面到机柜分层"产品范式,将由 Vera Rubin 平台延续下去。