Skip to main content

一颗 GPU 背后的七颗芯片:NVIDIA "七芯片堆栈"战略全拆解

· 7 min read
Industry Research Team

当竞争对手还在对比单颗 GPU 的 FLOPS 时,NVIDIA 已经把战场挪到了另一个维度。2026 年 GTC 发布的 Vera Rubin 平台,表面上是"新一代 GPU",实际上是一套由七颗芯片组成的完整 AI 工厂蓝图。据站内芯片数据库,这七颗芯片分别是:Vera CPU、Rubin GPU、NVLink 6 交换机、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 以太网交换机,以及 Groq 3 LPX。本文逐一拆解这套"七芯片堆栈"的分工、协同与战略意图。

七颗芯片,各司其职​

先看全局分工表(数据据站内芯片数据库):

#芯片角色关键规格
①Vera CPU主机调度中枢88 核自研 Olympus、1.5TB LPDDR5X、1.2TB/s
②Rubin GPU训练与 prefill 主力288GB HBM4、22TB/s 带宽、50 PFLOPS FP4
③NVLink 6 交换机纵向扩展互联单 GPU 3.6TB/s、NVL72 机柜 260TB/s
④ConnectX-9 SuperNIC横向扩展网络单端口 1.6T、延迟低于 0.5μs、GPUDirect
⑤BlueField-4 DPU基础设施卸载与存储驱动第三层推理上下文内存存储平台,token 吞吐最高 5 倍
⑥Spectrum-6 交换机数据中心以太网骨干Scale-out 网络核心
⑦Groq 3 LPX智能体解码加速256 颗 LPU/机架、128GB 聚合 SRAM、40 PB/s

七颗芯片覆盖了 AI 工厂从计算、互联、网络到存储的每一层——这是一个信号:NVIDIA 卖的不再是芯片,而是一整座工厂的参考设计。

计算层:Vera + Rubin + LPX 的异构三重奏​

计算层的分工体现了"每 token 经济学"的推理:

Rubin GPU 负责训练与 prefill。3360 亿晶体管、22TB/s 显存带宽,让它成为吞掉训练算力与推理 prefill(吃算力)这两个负载的最优解。

Groq 3 LPX 专攻智能体 decode。据站内芯片数据库,LPX 机架集成 256 颗 LPU,聚合 128GB 片上 SRAM 提供高达 40 PB/s 的片上带宽,互联达 640 TB/s。decode 阶段的核心瓶颈是内存带宽而非算力,LPU 用超大片上 SRAM 绕开这一瓶颈,延迟达到纳秒级——对于每秒上千次调用的 agentic AI 负载,这是 GPU 结构上难以企及的能力。GPU 管 prefill、LPU 管 decode,两种架构各干各的,总成本反而更低。

Vera CPU 是调度中枢。88 个自研 Olympus 核心、第二代 SCF 一致性结构(3.4TB/s 对分带宽)、1.5TB LPDDR5X 与 HBM4 构成单一一致性内存池,负责数据搬运调度、内存管理与系统控制编排——海量的智能体沙盒、KV 缓存卸载、多模型并发,都由它承接。

AI 工厂的网络是分层的,NVIDIA 用三颗芯片精确对应:

  • NVLink 6 交换机(Scale-up):机柜内纵向扩展,单 GPU 3.6TB/s 全互联带宽,让 72 乃至更多 GPU 像一颗 GPU 一样工作。这是训练超大模型的命脉,也是 NVIDIA 最深的护城河;
  • ConnectX-9 SuperNIC(Scale-out):单端口 1.6 Tb/s 的跨机柜网络,延迟低于 0.5 微秒,支持 GPU-NIC 直接 DMA,决定集群的横向扩展效率;
  • Spectrum-6 以太网交换机:承载南北向流量与存储网络,是数据中心以太网骨干。

三级网络的本质是把"AI 工厂"拆解成可量化的工程指标:token 从进入机房到输出,要经过计算、Scale-up、Scale-out、存储四类路径,NVIDIA 在每一条路径上都放了一颗自己设计的芯片。

BlueField-4:被忽视的第三层存储革命​

七芯片堆栈中最容易被低估的是 BlueField-4 DPU。它的战略意义在于驱动第三层推理上下文内存存储平台——在 GPU 显存(HBM)与主机内存(LPDDR5X)之外,用 DPU 管理一层专门的推理上下文存储,官方宣称可将 token 吞吐提升最高 5 倍。

这重构了经典的 HBM-DRAM-NAND 三层存储金字塔:智能体对话的 KV 缓存、多轮会话上下文,不再挤占宝贵的 HBM4 容量,而是按热度分层放置在三级存储中。对于长上下文、多轮对话的 agentic AI 负载,这一层的存在直接决定了"每 GB 有效 KV 容量成本"——一个纯 GPU 厂商根本无法优化的指标。

七芯片堆栈的封锁性引发过大客户反弹,NVIDIA 的回应是有选择的开放:

  • NVLink Fusion:向合作伙伴开放 NVLink 互联,允许其将自定义 CPU 或加速器集成进 NVIDIA 的 Scale-up 域——用互联标准换取生态驻留;
  • NVHBM 定制内存控制器计划:允许超大规模客户定制 HBM 配置,市场传闻亚马逊 Annapurna 团队正参与合作——把客户自研芯片的冲动,引导为"在 NVIDIA 平台上定制"的合作姿态。

这步棋颇为高明:客户想自研的动机无非是定制与议价,NVIDIA 干脆把定制能力开放出来,但互联与软件栈的根仍握在自己手里。

系统级竞争:对手的对位打法​

Bain 在 2026 年的行业分析给出了一个重要判断:AI 算力的竞争优势正从芯片规格转向系统级整合。这解释了为什么各大厂商都在拼"整栈":

厂商CPUGPU/加速器互联/网络开放程度
NVIDIAVera(自研)Rubin R200NVLink 6 + ConnectX-9 + Spectrum-6NVLink Fusion 有限开放
AMDEPYC VeniceMI455X/MI500Vulcano NIC + UALink开放标准联盟
华为自研鲲鹏系昇腾系列灵衢 UnifiedBus国内生态自主

AMD Helios 机架的组合是 EPYC Venice(256 核 Zen 6)+ MI455X + Vulcano 网络芯片,以 UALink 开放标准对抗 NVLink 的封闭性——用"开放"换生态盟友。华为的灵衢 UnifiedBus 则在国内市场构建对位体系。但双方都面临同一个难题:NVIDIA 的七芯片是同步迭代的——Vera 与 Rubin 同代设计、NVLink 6 为 HBM4 的带宽特性量身定做、LPX 与 GPU 的 prefill/decode 分工在参考架构层面打通。对手的"拼装式整栈"在迭代节奏上天然慢一拍。

小结​

七芯片堆栈是 NVIDIA 对"AI 工厂"时代的一次完整应答:计算层用 Vera、Rubin、LPX 实现异构分工,互联层用 NVLink 6、ConnectX-9、Spectrum-6 铺设三级网络,BlueField-4 则重构了推理存储的金字塔。再辅以 NVLink Fusion 的有限开放与 NVHBM 定制计划,NVIDIA 把竞争维度从"单芯片规格"彻底抬升到"系统级整合"——Bain 的判断在这里得到了最好的注脚。对买方而言,评估下一笔 AI 基础设施投资时,问题已经不该是"这颗 GPU 多少 TFLOPS",而是"这套系统能把每 token 成本压到多少"。谁能回答好后者,谁就赢得下一个五年。