一颗 GPU 背后的七颗芯片:NVIDIA "七芯片堆栈"战略全拆解
当竞争对手还在对比单颗 GPU 的 FLOPS 时,NVIDIA 已经把战场挪到了另一个维度。2026 年 GTC 发布的 Vera Rubin 平台,表面上是"新一代 GPU",实际上是一套由七颗芯片组成的完整 AI 工厂蓝图。据站内芯片数据库,这七颗芯片分别是:Vera CPU、Rubin GPU、NVLink 6 交换机、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 以太网交换机,以及 Groq 3 LPX。本文逐一拆解这套"七芯片堆栈"的分工、协同与战略意图。
七颗芯片,各司其职
先看全局分工表(数据据站内芯片数据库):
| # | 芯片 | 角色 | 关键规格 |
|---|---|---|---|
| ① | Vera CPU | 主机调度中枢 | 88 核自研 Olympus、1.5TB LPDDR5X、1.2TB/s |
| ② | Rubin GPU | 训练与 prefill 主力 | 288GB HBM4、22TB/s 带宽、50 PFLOPS FP4 |
| ③ | NVLink 6 交换机 | 纵向扩展互联 | 单 GPU 3.6TB/s、NVL72 机柜 260TB/s |
| ④ | ConnectX-9 SuperNIC | 横向扩展网络 | 单端口 1.6T、延迟低于 0.5μs、GPUDirect |
| ⑤ | BlueField-4 DPU | 基础设施卸载与存储 | 驱动第三层推理上下文内存存储平台,token 吞吐最高 5 倍 |
| ⑥ | Spectrum-6 交换机 | 数据中心以太网骨干 | Scale-out 网络核心 |
| ⑦ | Groq 3 LPX | 智能体解码加速 | 256 颗 LPU/机架、128GB 聚合 SRAM、40 PB/s |
七颗芯片覆盖了 AI 工厂从计算、互联、网络到存储的每一层——这是一个信号:NVIDIA 卖的不再是芯片,而是一整座工厂的参考设计。
计算层:Vera + Rubin + LPX 的异构三重奏
计算层的分工体现了"每 token 经济学"的推理:
Rubin GPU 负责训练与 prefill。3360 亿晶体管、22TB/s 显存带宽,让它成为吞掉训练算力与推理 prefill(吃算力)这两个负载的最优解。
Groq 3 LPX 专攻智能体 decode。据站内芯片数据库,LPX 机架集成 256 颗 LPU,聚合 128GB 片上 SRAM 提供高达 40 PB/s 的片上带宽,互联达 640 TB/s。decode 阶段的核心瓶颈是内存带宽而非算力,LPU 用超大片上 SRAM 绕开这一瓶颈,延迟达到纳秒级——对于每秒上千次调用的 agentic AI 负载,这是 GPU 结构上难以企及的能力。GPU 管 prefill、LPU 管 decode,两种架构各干各的,总成本反而更低。
Vera CPU 是调度中枢。88 个自研 Olympus 核心、第二代 SCF 一致性结构(3.4TB/s 对分带宽)、1.5TB LPDDR5X 与 HBM4 构成单一一致性内存池,负责数据搬运调度、内存管理与系统控制编排——海量的智能体沙盒、KV 缓存卸载、多模型并发,都由它承接。
互联层:NVLink 6 + ConnectX-9 + Spectrum-6 的三级网络
AI 工厂的网络是分层的,NVIDIA 用三颗芯片精确对应:
- NVLink 6 交换机(Scale-up):机柜内纵向扩展,单 GPU 3.6TB/s 全互联带宽,让 72 乃至更多 GPU 像一颗 GPU 一样工作。这是训练超大模型的命脉,也是 NVIDIA 最深的护城河;
- ConnectX-9 SuperNIC(Scale-out):单端口 1.6 Tb/s 的跨机柜网络,延迟低于 0.5 微秒,支持 GPU-NIC 直接 DMA,决定集群的横向扩展效率;
- Spectrum-6 以太网交换机:承载南北向流量与存储网络,是数据中心以太网骨干。
三级网络的本质是把"AI 工厂"拆解成可量化的工程指标:token 从进入机房到输出,要经过计算、Scale-up、Scale-out、存储四类路径,NVIDIA 在每一条路径上都放了一颗自己设计的芯片。
BlueField-4:被忽视的第三层存储革命
七芯片堆栈中最容易被低估的是 BlueField-4 DPU。它的战略意义在于驱动第三层推理上下文内存存储平台——在 GPU 显存(HBM)与主机内存(LPDDR5X)之外,用 DPU 管理一层专门的推理上下文存储,官方宣称可将 token 吞吐提升最高 5 倍。
这重构了经典的 HBM-DRAM-NAND 三层存储金字塔:智能体对话的 KV 缓存、多轮会话上下文,不再挤占宝贵的 HBM4 容量,而是按热度分层放置在三级存储中。对于长上下文、多轮对话的 agentic AI 负载,这一层的存在直接决定了"每 GB 有效 KV 容量成本"——一个纯 GPU 厂商根本无法优化的指标。
生态锁定:NVLink Fusion 与定制化开放
七芯片堆栈的封锁性引发过大客户反弹,NVIDIA 的回应是有选择的开放:
- NVLink Fusion:向合作伙伴开放 NVLink 互联,允许其将自定义 CPU 或加速器集成进 NVIDIA 的 Scale-up 域——用互联标准换取生态驻留;
- NVHBM 定制内存控制器计划:允许超大规模客户定制 HBM 配置,市场传闻亚马逊 Annapurna 团队正参与合作——把客户自研芯片的冲动,引导为"在 NVIDIA 平台上定制"的合作姿态。
这步棋颇为高明:客户想自研的动机无非是定制与议价,NVIDIA 干脆把定制能力开放出来,但互联与软件栈的根仍握在自己手里。
系统级竞争:对手的对位打法
Bain 在 2026 年的行业分析给出了一个重要判断:AI 算力的竞争优势正从芯片规格转向系统级整合。这解释了为什么各大厂商都在拼"整栈":
| 厂商 | CPU | GPU/加速器 | 互联/网络 | 开放程度 |
|---|---|---|---|---|
| NVIDIA | Vera(自研) | Rubin R200 | NVLink 6 + ConnectX-9 + Spectrum-6 | NVLink Fusion 有限开放 |
| AMD | EPYC Venice | MI455X/MI500 | Vulcano NIC + UALink | 开放标准联盟 |
| 华为 | 自研鲲鹏系 | 昇腾系列 | 灵衢 UnifiedBus | 国内生态自主 |
AMD Helios 机架的组合是 EPYC Venice(256 核 Zen 6)+ MI455X + Vulcano 网络芯片,以 UALink 开放标准对抗 NVLink 的封闭性——用"开放"换生态盟友。华为的灵衢 UnifiedBus 则在国内市场构建对位体系。但双方都面临同一个难题:NVIDIA 的七芯片是同步迭代的——Vera 与 Rubin 同代设计、NVLink 6 为 HBM4 的带宽特性量身定做、LPX 与 GPU 的 prefill/decode 分工在参考架构层面打通。对手的"拼装式整栈"在迭代节奏上天然慢一拍。
小结
七芯片堆栈是 NVIDIA 对"AI 工厂"时代的一次完整应答:计算层用 Vera、Rubin、LPX 实现异构分工,互联层用 NVLink 6、ConnectX-9、Spectrum-6 铺设三级网络,BlueField-4 则重构了推理存储的金字塔。再辅以 NVLink Fusion 的有限开放与 NVHBM 定制计划,NVIDIA 把竞争维度从"单芯片规格"彻底抬升到"系统级整合"——Bain 的判断在这里得到了最好的注脚。对买方而言,评估下一笔 AI 基础设施投资时,问题已经不该是"这颗 GPU 多少 TFLOPS",而是"这套系统能把每 token 成本压到多少"。谁能回答好后者,谁就赢得下一个五年。