Skip to main content

Vera CPU 深度:SCF + 1.5TB LPDDR5X,NVIDIA 自研 CPU 的野心

· 7 min read
Industry Research Team

当所有人盯着 Rubin R200 的 50 PFLOPS FP4 时,真正决定这台机器推理经济性的,可能是一颗 CPU。Vera——NVIDIA 首次全面自研核心的数据中心 CPU,用 88 个 Olympus 核心、第二代 SCF 一致性结构和 1.5TB LPDDR5X,重新定义了"AI 工厂的主机处理器"。本文依据站内芯片数据库与智能体基准实测,拆解 NVIDIA 从外购 Arm 核到自研 SCF 的演进逻辑。

从 Grace 到 Vera:自研之路的三级跳​

NVIDIA 的 CPU 战略经历了三个阶段:GH200/GB200 时代的 Grace CPU 基于 72 核 Neoverse V2 公版 Arm 核心,本质是"外购核心 + 自研互联";GB300 延续了这一代 Grace;而 2026 年 GTC 发布的 Vera 则完成质变——核心、片上互连、内存子系统全部自研。据站内芯片数据库,Vera 的核心规格如下:

规格参数
CPU 架构ARM 架构(自研 Olympus 核心)
指令集ARMv9.2(完全兼容)
核心数量88 个 Olympus 核心
线程数量176 个线程(空间多线程)
单核性能前代产品的 2 倍
最大内存容量1.5 TB(LPDDR5X)
内存带宽1.2 TB/s
互联技术NVLink-C2C(1.8 TB/s)
片上互连第二代 SCF(3.4 TB/s 对分带宽)
发布时间2026 年 3 月 17 日
量产时间2026 年下半年

SCF:88 核无延迟扩展的底座​

SCF(Scalable Coherency Fabric,可扩展一致性结构)是 Vera 最值得细看的技术。第二代 SCF 提供 3.4 TB/s 对分带宽,采用片上网格 + 统一缓存设计,可无延迟扩展 88 个核心。

对分带宽(bisection bandwidth)是衡量片上互连质量的关键指标:它表示把芯片切成两半时,两半之间的总通信带宽。88 核的大芯片如果对分带宽不足,核心越多内耗越大。第二代 SCF 用网格拓扑让任意核心间的通信路径趋于均匀,配合统一缓存避免一致性流量的长距离穿梭——这正是 Vera 敢于采用单体计算芯片设计(而非多小芯片拼接)的底气:避免跨小芯片通信延迟,在所有核心满载时保持稳定延迟和吞吐量,性能可预测性强。

1.5TB LPDDR5X:把内存子系统当主武器​

Vera 将 SCF 与高达 1.5TB 的 LPDDR5X 内存子系统结合。对比上一代 Grace 的规格变化一目了然:

指标Grace(GB200/GB300)Vera提升
内存容量480GB LPDDR5X最高 1.5TB LPDDR5X约 3 倍
内存带宽512 GB/s1.2 TB/s约 2.3 倍
CPU-GPU 互联NV-HBI 900 GB/sNVLink-C2C 1.8 TB/s2 倍
核心数72 核 Neoverse V288 核 Olympus+22%

更关键的是系统级设计:LPDDR5X 与 GPU 的 HBM4 可视为单一一致性内存池。这意味着数据不再需要在"CPU 内存"和"显存"之间显式搬运,两个物理上分离的内存子系统在软件视角下是一体的。对推理业务,这带来两个直接收益:KV 缓存卸载——不常用的注意力上下文可以下沉到 LPDDR5X 侧,把昂贵的 HBM4 带宽留给热点数据;多模型高效执行——多个模型实例共享同一内存池,切换与加载开销大幅降低。

Daytona 实测:智能体时代的 CPU 门槛​

2026 年 10 月 10 日公布的 Daytona 智能体基准测试,给 Vera 的实际能力提供了量化注脚。智能体负载的特点是海量并发沙盒的创建与销毁——恰恰考验 CPU 的内存容量、一致性与调度效率:

测试项VeraAMD EPYC 9755差距
1000 沙盒上线10.8 秒88.4 秒约 8 倍
峰值智能体任务吞吐13.3 任务/秒——
2000 沙盒上线27.4 秒——

8 倍的沙盒上线速度差距说明:智能体负载对 CPU 的要求已与通用计算分道扬镳——容量大(1.5TB 装下海量沙盒状态)、带宽高(1.2TB/s 喂饱并发)、一致性结构强(88 核高效协作)。站内芯片数据库同时记录,Vera 的软件环境运行速度相比传统架构 CPU 提升最高 50%,满负载下强化学习评估周期可缩短 50%。

与 Groq 3 LPX 的异构分工​

Vera 所在的 Rubin 平台还有一位非常规队友:NVIDIA 收购 Groq 后推出的 Groq 3 LPX。据站内芯片数据库,LPX 机架集成 256 颗 LPU,聚合 128GB 片上 SRAM,聚合带宽高达 40 PB/s,官方口径的能效优势显著(35× perf/W vs H100 推理)。在 Rubin 平台的分工中,GPU 承担训练与 prefill,Groq 3 LPX 专攻智能体解码阶段的低延迟输出——而 Vera 则是这一切的调度中枢。prefill 吃算力、decode 吃带宽、调度吃一致性与容量,三种负载由三种架构分别消化,这正是"每 token 经济学"推导出的异构架构必然性。

Vera vs EPYC Venice:服务器 CPU 的新战场​

Vera 的出现让 NVIDIA 与 AMD 在服务器 CPU 领域正面相遇。据站内芯片数据库,AMD EPYC Venice(2026 CES 发布)是全球首款 2nm 数据中心 CPU:

指标NVIDIA VeraAMD EPYC Venice(Zen 6C)
核心88 个自研 Olympus最多 256 个 Zen 6C
制程未公开台积电 2nm(N2)
内存1.5TB LPDDR5X16 通道 DDR5
单路带宽1.2 TB/s1.6 TB/s
L3 缓存—1GB
卖点NVLink-C2C、CPU-GPU 一致性通用性、x86 生态

两者的定位差异明显:EPYC Venice 是通用数据中心 CPU 的极致(256 核、x86 生态、Helios 机架中与 MI455X 组队),而 Vera 是 AI 专用 CPU——它不做通用服务器生意,只为 AI 工厂的主机负载优化。Vera 甚至支持硬件级 FP8 计算,是全球首款支持 FP8 精度的 CPU,并支持全机密计算的硬件级安全隔离。竞争的天平取决于一个问题:AI 工厂的 CPU 采购,会不会整体从通用服务器预算中剥离?如果会,Vera 绑定 Rubin GPU 的销售模式将是护城河;如果不会,EPYC 的生态广度仍难撼动。

小结​

Vera CPU 标志着 NVIDIA 完成了从"用别人的核心攒超级芯片"到"自研全套主机平台"的跃迁:SCF 的 3.4TB/s 对分带宽解决了 88 核扩展难题,1.5TB LPDDR5X 与 HBM4 构成的一致性内存池重构了推理数据流,Daytona 实测的 8 倍沙盒优势则证明智能体负载确实需要一颗不一样的 CPU。它的野心不在挑战 x86 的通用服务器王座,而是重新划定一条边界——AI 基础设施中,CPU 是 GPU 子系统的一部分,而不是独立采购的商品。这条边界能否成立,将决定未来五年服务器市场的版图。