Skip to main content

36 posts tagged with "Tech Deep Dive"

Deep analysis of AI chip architecture, HBM, interconnect, packaging

View all tags

CUDA 城墙下的三条隧道:CANN 开源、ROCm 补课与 PyTorch 中立层

· 6 min read
Industry Research Team

CUDA 的护城河有多深?20 年的代码沉淀、与主流框架的深度绑定、一代工程师的肌肉记忆。但 2026 年,三条隧道正在城墙下方掘进:华为 CANN 全面开源,AMD ROCm 借 MI455X 补课,PyTorch/Triton 中立层持续稀释锁定。本文逐条拆解。

CUDA 护城河的本质​

CUDA 不是一个库,而是一整套生态惯性。站内 NVIDIA 规格卡反复出现的细节印证了这一点:RTX Spark 全栈 CUDA、DGX OS 预装完整 NVIDIA 软件栈、PyTorch with CUDA 原生兼容。护城河由三层构成:

  1. 代码沉淀:cuDNN、cuBLAS、NCCL、TensorRT 等组件经过近 20 年打磨,算子覆盖度与稳定性无可替代;
  2. 框架绑定:PyTorch、TensorFlow 的默认后端是 CUDA,新模型上线第一天就有 CUDA 支持;
  3. 人才习惯:开发者学的是 CUDA 编程模型,迁移到任何新平台都有重学成本。

这种惯性意味着:即使竞品硬件性能追平,软件栈差距仍会让用户停留在原平台。要翻越这堵墙,硬攻不如打隧道。

隧道一:CANN 开源,用开放换生态​

华为选择的路是把家底亮出来。站内昇腾 960 规格卡记录:CANN 全面开源并进入常态化社区运营,外部开发者占比升至 61%(首次超越内部团队),月活跃开发者突破 5200 人。HC2026 补充口径进一步给出:CANN 已支持 40+ 模型原生训练,兼容 PyTorch、Triton、vLLM、veRL 等 90+ 开源项目,并成为 PyTorch 官网首个中国算力平台。

更关键的是头部模型厂商的背书:DeepSeek 与华为联合开源了面向昇腾 950 加速器的编程工具与库(含计算与通信库),明确瞄准降低 NVIDIA 生态锁定。当最强的开源模型团队直接参与昇腾工具链共建,"昇腾只能跑推理"的旧叙事被正式改写——DeepSeek 此前已在昇腾上完成训练侧验证。

CANN 策略的本质是:单芯片性能可以落后一代,但只要开源生态的迁移摩擦足够小,系统级方案(4096 卡超节点、统一内存编址)就能补齐单卡差距。

隧道二:ROCm 补课,用性能换迁移​

AMD 的路线不同:不是换赛道,而是在 CUDA 的主场追赶。站内 MI455X 规格卡显示:CDNA 5 架构、432GB HBM4、MXFP4 算力 40.3 PFLOPS,2026 Q3 末出货、H2 2026–H1 2027 规模爬坡;MI430X 支持 FP64 双精度并将驱动 LUMI-AI 超算。硬件到位之后,ROCm 的补课重心是算子覆盖与框架兼容——从 PyTorch 官方支持到 vLLM/sglang 的推理后端适配,开源社区的力量正在把 ROCm 从"能用"推向"好用"。

维度CANN(华为)ROCm(AMD)CUDA(NVIDIA)
策略全面开源换生态性能追平 + 兼容层补课闭源完整栈
开发者规模外部占比 61%、月活 5200+开源社区驱动全球最大基数
框架支持PyTorch/Triton/vLLM 等 90+ 项目PyTorch 官方后端默认后端
2026 里程碑PyTorch 官网首个中国算力平台MI455X 量产、LUMI-AI 背书Rubin 平台七芯片堆栈
短板单卡性能落后一代生态成熟度仍逊于 CUDA闭源、锁定深

国产第二梯队的路径也值得注意:站内天数智芯天垓150 规格卡记录,其软件栈 IXUCA 高度兼容 CUDA 生态,官方口径迁移时间下降 50% 以上,适配主流深度学习框架与 200+ 模型(厂商口径)。兼容 CUDA 的"寄生式"策略,是在城墙阴影下最务实的生存方式。

隧道三:PyTorch/Triton 中立层稀释锁定​

前两条隧道是厂商挖的,第三条是社区挖的。PyTorch 2.x 的 compiler 栈(torch.compile)与 OpenAI Triton 让开发者写的模型代码可以不直接接触 CUDA——同一份 PyTorch 代码在 CUDA、ROCm、CANN 后端之间切换的成本逐年下降。当模型定义层与硬件执行层解耦,CUDA 的"默认后端"地位就从护城河变成了可选组件。CANN 能进 PyTorch 官网、ROCm 能成为官方后端,都是这个中立层稀释效应的体现。

绕过式创新:SINQ 与 Strata​

除了正面挖隧道,还有两条"绕过"城墙的小路:

  • 华为苏黎世实验室开源的 SINQ 量化技术:官方测试称可将大模型显存占用削减约 60%-70%——显存需求骤降后,原本装不下的模型可以装进更小的卡,硬件门槛被算法直接拉低;
  • OpenAI Strata 开源推理引擎:基于 C++20 与 CUDA,在 12-24GB 的游戏显卡上运行 125B Qwen MoE 模型,吞吐 60-95 tok/s,核心创新是专家缓存机制(CPU/GPU 并行)。它证明了软件创新可以让"消费级显卡跑大模型"成为现实。

这两项技术的共同点是:用算法层创新绕过硬件层差距——量化绕过显存墙,MoE 专家缓存绕过算力墙。软件栈竞争的维度因此变得更加多维。

开发者迁移决策树​

面对多平台选择,一个务实的决策路径:

  1. 训练前沿模型? 优先 CUDA 栈——算子覆盖与稳定性仍是训练侧硬需求,除非有明确的国产化合规要求;
  2. 国产化合规优先? 评估 CANN:40+ 模型原生训练、PyTorch/Triton/vLLM 支持已覆盖主流工作流,用小规模试点验证自己的模型清单;
  3. 推理为主、成本敏感? ROCm 平台(MI455X 432GB 显存)与 Strata 类引擎值得 POC,量化技术(SINQ 等)可显著降低硬件档位;
  4. 多平台部署? 把代码收敛到 PyTorch/Triton 中立层,避免深度依赖平台专有 API——这是面向未来的对冲。

小结​

CUDA 的城墙依然坚固,但 2026 年的掘进速度前所未有:CANN 用开源把外部开发者占比推到 61%,ROCm 借 MI455X 量产获得性能与出货的双重背书,PyTorch/Triton 中立层则从根上稀释锁定价值。叠加 SINQ、Strata 这类绕过式创新,"非 CUDA 平台不好用"的断言正在失效。对开发者而言,最优策略不是站队,而是站到中立层上——让每一条隧道都成为自己的备选出口。

制程竞赛 2026:N2 量产、18A 蓄力、High-NA EUV 百万晶圆

· 5 min read
Industry Research Team

每一次制程换代都会重新洗牌 AI 算力格局。2026 年,2nm 从路线图走进量产车间:AMD 抢下 N2 AI GPU 首发权,EPYC Venice 成为全球首款 2nm 数据中心 CPU,Intel 的 High-NA EUV 则悄悄跨过百万晶圆门槛。制程竞赛的规则,也在这一年悄悄改变。

制程、能效与晶体管密度的链条​

制程的意义可以用一条链概括:更小的晶体管 → 更高的密度与更低的开关功耗 → 同样封装面积塞进更多计算单元与更大缓存 → 单位 token 的能耗与成本下降。对 AI 芯片而言,这条链的最后一段尤其重要——推理集群的电费和散热已经取代芯片采购价,成为 TCO 的最大头之一,制程每前进一代,同等机柜功率下能跑的 token 数就上一个台阶。

2026 年的 2nm 落地图谱如下:

厂商产品制程状态与要点
AMDInstinct MI455XTSMC N2 计算芯粒 + N3 I/O 与缓存芯粒首款 TSMC N2 AI GPU,3200 亿晶体管,432GB HBM4,2026-07-23 发布
AMDEPYC Venice(Zen 6)TSMC N2全球首款 2nm 数据中心 CPU,256 核,2026 年 5 月量产
GoogleTPU 8t(Trillium 2)TSMC 2nm训练专用 ASIC,双计算 Die,9600 芯片 Pod,121 EFLOPS FP4
IntelFoundry High-NA EUV 产线High-NA EUV已处理超 100 万片晶圆(2026-09-21 当周口径)
三星2nm AI 芯片制程SF2 路线联合台积电推进,目标 2027 年量产,宣称能效比提升 40%(2026-09 口径)

N2 AI GPU 首发为何是 AMD​

按过往节奏,新制程的首发大客户通常是谁?答案是 AMD——而且这不是偶然。MI455X 采用 8 个 N2 计算芯粒(XCD)加 2 个 I/O die 与 2 个缓存/fabric die(N3)的混合封装:把最吃密度的计算芯粒放最先进节点,把成本敏感的 I/O 与缓存留在成熟一档的 N3,用 CoWoS-L 先进封装拼合,既拿到 2nm 的能效红利,又控制了整片成本。

同一家公司连下两城:EPYC Venice 用 N2 做出 8 颗 Zen 6C CCD、每颗 32 核、总计 256 核、1GB L3 缓存的怪兽 CPU,单路内存带宽 1.6TB/s,与 MI455X 组成 Helios 机架(18 颗 Venice + 72 颗 MI455X,31TB HBM4,2.9 FP4 exaFLOPS)。CPU 与 GPU 同代同步上新制程,是 AMD chiplet 战略的复利——分芯粒设计天然适配"最先进节点给计算、次先进节点给 I/O"的分配策略。Google TPU 8t 也选择了同样的 N2 + Broadcom 协作路线,印证了"定制 ASIC 抢新制程"的趋势。

High-NA EUV 百万晶圆的意义​

Intel 在 2026 年 9 月 21 日当周披露,其 Foundry 的 High-NA EUV 产线累计处理晶圆已超过 100 万片。这个数字的意义在于:High-NA EUV——分辨率更高、专为 2nm 及以下节点准备的下一代光刻机——从"实验室样机"正式进入"规模化生产"阶段。百万晶圆意味着工艺窗口验证、良率爬坡和产能利用都跨过了商业化门槛,Intel 18A 与 14A 路线因此有了现实的制造底盘。

对照看三星的动作同样密集:HBM4 已于 2026 年 2 月量产(成为 Rubin 等旗舰 GPU 的 HBM 供应商之一),2nm AI 芯片制程则与台积电形成竞争态势,目标 2027 年量产。制程竞赛与 HBM 竞赛第一次同步开跑。

"十年之约":平台期被拉长​

台积电的投入力度佐证了这个节点的分量:2026 年 CAPEX 顶格到 560 亿美元上限,全年营收增速指引 30% 以上,3nm 产能同时在台湾、亚利桑那与熊本三地扩张。但硬币的另一面是 ASML 与 ZEISS 给出的"十年之约"——下一代光刻(High-NA 之后的技术)可能还需要十年才能成熟。这意味着 2nm/1.4nm 将成为一个超长平台期:没有新的光学分辨率红利可吃,各家的竞争焦点必须转移。

转移的方向已经很清晰。第一是先进封装:MI455X 的 12 颗 HBM4 堆栈、Rubin 的 MCM 多芯片设计,都说明系统级创新正在替代晶体管微缩。第二是 HBM 配套:N2 计算芯粒如果没有 22-23TB/s 的 HBM4 喂数据,算力就是摆设——制程与内存的协同定义能力,比制程数字本身更能决定产品成败。

小结​

2026 年的制程竞赛呈现出三个信号:2nm 实力量产,AMD 借 chiplet 架构连夺 AI GPU 与数据中心 CPU 双首发,Google 定制 ASIC 跟进;Intel 用 High-NA EUV 百万晶圆宣告制造能力回归牌桌;而 ASML 的十年之约意味着制程数字的边际收益递减,先进封装、HBM 协同与能效工程将成为新的竞争主轴。对 AI 算力买家来说,评估一颗芯片时,"几纳米"正在变成一个越来越不完整的答案——封装里装了什么、带宽喂了多少、每瓦能跑多少 token,才是更完整的提问方式。

Rubin R200 深度解析:3360亿晶体管、288GB HBM4、50 PFLOPS FP4 的代际跨越

· 7 min read
Industry Research Team

2026 年 3 月 17 日的 GTC 大会上,NVIDIA 正式发布了 Rubin R200——这颗基于 3nm 制程、集成 3360 亿晶体管的 AI GPU,用 2.75 倍显存带宽和 5 倍 FP4 推理算力,完成了对 Blackwell 的一次教科书式代际跨越。本文依据站内芯片数据库数据,结合 MLPerf Inference v6.1 实测结果,拆解这颗芯片的技术细节与系统级打法。

核心规格总览​

据站内芯片数据库,Rubin R200 的完整规格如下:

规格参数
GPU 架构Rubin 架构(MCM 多芯片模块设计)
制程工艺台积电 3nm N3P(计算 die)+ N5B(I/O die)
晶体管数量3360 亿
SM 数量224 个
FP4 推理算力50 PFLOPS(sparse)
FP4 训练算力35 PFLOPS(sparse)
FP8/FP6 算力17.5 PFLOPS(sparse)
显存容量288 GB HBM4
显存带宽22 TB/s
互联技术NVLink 6(单向 3.6 TB/s)
TDP1800-2300W(必须液冷)
量产时间2026 年 6 月(全面量产)
定价单 NVL72 机柜 350-400 万美元

单看数字,Rubin R200 的 TDP 达到 1800-2300W,是 B200(1000W)的近两倍——功耗墙的持续抬升,正是当代 AI 芯片竞争的缩影:算力提升越来越依赖"堆晶体管 + 堆显存 + 堆带宽"的三重奏。

MCM 设计:2+2+8 的多芯片方程式​

Rubin R200 没有走"单颗巨 die"的路线,而是采用多芯片模块(MCM)设计,核心包含三部分:

  • 2 颗计算 die:GPU 核心本体,采用台积电 3nm N3P 工艺;
  • 2 颗 I/O die:负责 HBM 控制器与 NVLink 物理层,采用成本更低的 N5B 工艺;
  • 8 颗 HBM4 显存堆栈:提供 288GB 总容量。

这种"计算与 I/O 分离"的设计是 HBM4 时代的必然选择。HBM4 的接口宽度翻倍到每堆栈 2048bit,如果继续让 3nm 计算 die 直接挂载 HBM 控制器,die 面积将被大量 I/O 逻辑占据,成本失控。把 HBM 控制器和 NVLink PHY 下放到 N5B 工艺的 I/O die,既保护了最昂贵的 3nm 面积,又让存储互联部分可以独立迭代——这也是 AMD 在 MI400 系列上殊途同归的工程共识。

第三代 Transformer Engine​

Rubin 架构的第三代 Transformer Engine 支持硬件级自适应精度压缩,不需要重写模型代码即可在 FP4/FP6/FP8/FP16/BF16/TF32/FP32/FP64 之间动态切换。对用户而言,这意味着 FP4 量化不再是"敢不敢用"的权衡,而是训练与推理管线的默认状态。

HBM4:接口翻倍如何换来 2.8 倍带宽​

显存是这代产品最戏剧性的升级点。据站内芯片数据库的对比数据:

对比项Blackwell B200Rubin R200提升比例
晶体管数2080 亿3360 亿1.6 倍
显存容量192GB HBM3e288GB HBM41.5 倍
显存带宽8 TB/s22 TB/s2.75 倍
NVLink 带宽1.8 TB/s3.6 TB/s2 倍
FP4 推理算力~10 PFLOPS50 PFLOPS5 倍
TDP1000W1800-2300W1.8-2.3 倍

HBM4 将单堆栈接口从 HBM3e 的 1024bit 翻倍到 2048bit,引脚速率提升至 10.8 GT/pin 左右。两个因素相乘,让单堆栈带宽突破 2.7 TB/s 量级——8 个堆栈聚合后达到 22 TB/s,相比 B200 的 8 TB/s 实现 2.75 倍提升。相比 B300 Ultra(288GB HBM3e、8 TB/s 带宽),容量持平但带宽提升 2.75 倍;而对比 B200 的 FP4 算力是 5 倍,对比 FP4 sparse 口径的 B300 Ultra 则约 3.3 倍。

值得注意的是 HBM4 的供货格局:三星、SK 海力士、美光三家多源供货,其中 SK 海力士 12 层 HBM4(36GB/堆栈、2.8 TB/s/堆栈、11 Gbps)已于 2026 年 7 月启动量产出货。多源策略显著降低了 NVIDIA 在 HBM4 时代的供应链风险。

单 GPU 的 NVLink 6 互联带宽达到 3.6 TB/s(双向),是上一代 1.8 TB/s 的整整两倍。在一个 NVL72 机柜内,72 颗 Rubin R200 与 36 颗 Vera CPU 全互联,机柜总 NVLink 带宽达 260 TB/s。

Vera Rubin NVL72 的机柜级规格(据站内芯片数据库):

  • 总算力:FP4 约 3.6 EFLOPS
  • 总显存:20.7 TB HBM4
  • 总带宽:1.58 PB/s
  • TDP:约 180kW(必须全液冷)
  • 定价:350-400 万美元

规划中的 Vera Rubin NVL144 将把 144 颗 Rubin R200 装进一个互联域,FP4 总算力约 7.2 EFLOPS,NVIDIA 宣称大模型推理成本可降至 Blackwell 平台的 1/10。

MLPerf 实测:99% 扩展效率意味着什么​

2026 年 9 月 16 日,Rubin R200 在 MLPerf Inference v6.1 上完成首秀:

测试项对比基准(GB300 NVL72)提升
Qwen3-VL 吞吐同配置最高 3.7 倍
DeepSeek-R1 吞吐同配置最高 2.5 倍
288 卡扩展效率—99%

99% 的 288 卡扩展效率是比峰值算力更有说服力的指标——它意味着 NVLink 6 与系统软件栈在跨机柜扩展时几乎没有"漏水",集群规模翻倍时吞吐也近乎线性翻倍。对于按 token 计价的推理业务,NVIDIA 宣称 Rubin 平台的推理 token 成本最高可降 10 倍。

量产节奏与客户版图​

  • CES 2026:NVIDIA 宣布 Vera Rubin NVL72 进入全面投产,H2 2026 出货;
  • 首批客户:AWS 与微软率先确认;站内芯片数据库同时记录 CoreWeave、Google Cloud、Microsoft Azure、Oracle Cloud 的 NVL72 机柜已交付并扩大部署;
  • OpenAI 合作:NVIDIA 计划与 OpenAI 合建的首个 1GW 数据中心将于 2026 H2 通过 Rubin 平台交付;
  • 自建机房用户:2027 年第一季度可采购。

"七芯片堆栈":R200 只是一部分​

理解 Rubin R200,不能只看这颗 GPU。Vera Rubin 平台的完整组成是七颗芯片:Vera CPU + Rubin GPU + NVLink 6 交换机 + ConnectX-9 SuperNIC + BlueField-4 DPU + Spectrum-6 以太网交换机 + Groq 3 LPX(专为智能体解码阶段设计的低延迟推理加速器)。

这套组合拳的逻辑很清晰:训练吃算力,推理吃带宽与延迟,而不同环节由不同架构的芯片承担,整体效率最高。GPU 负责训练与 prefill,Groq 3 LPX 负责智能体 decode 阶段的低延迟输出,网络芯片保证 72 乃至 576 卡像一个 GPU 一样工作。竞争对手要在单点芯片上追平 R200 的规格或许可行,但要复制整套系统,难度完全不在一个量级。

小结​

Rubin R200 是一次典型的"系统级代际跨越":3360 亿晶体管和 50 PFLOPS FP4 是显性的规格领先,而 MCM 封装、HBM4 多源供货、NVLink 6 的 99% 扩展效率,以及七芯片堆栈的完整生态,才是 350-400 万美元机柜定价背后的真正护城河。H2 2026 大规模出货后,AI 算力市场的竞争焦点将进一步从"单芯片跑分"转向"每 token 成本"——这正是 Rubin 平台设计之初就瞄准的战场。

从 Rubin Ultra 到 Feynman:NVIDIA 2027-2028 路线图全解读

· 7 min read
Industry Research Team

当 Rubin R200 还在陆续爬坡之际,NVIDIA 的下一个两年已经被写进路线图:2027 H2 的 Rubin Ultra 与 2028 年的 Feynman。但与以往"官宣即定型"不同,Rubin Ultra 在 2026 年经历了一次罕见的架构大改——原版 4 芯片设计被取消。本文依据站内芯片数据库与行业路线图口径,拆解这次调整背后的工程与商业逻辑。

Rubin Ultra(V300):从官宣到修订​

Rubin Ultra 在 GTC 2026(2026-03-17)与 Rubin R200 一同公布,定位超大规模训练/推理的顶端产品。据站内芯片数据库,其原版设计规格如下:

规格参数(原版设计,待官方最终确认)
GPU 架构Rubin 架构(MCM 多芯片模块)
封装原版 4 芯片设计(已取消)
FP4 推理算力推测约 100 PFLOPS(原版,密集)
FP8 训练算力推测约 70 PFLOPS(原版)
显存容量576 GB HBM4e(原版设计)
显存带宽推测 >44 TB/s(HBM4e)
互联技术NVLink 7(推测,单向 >3.6 TB/s)
TDP推测 3000W+(必须液冷)
量产时间推测 2027 H2 – 2028
定价推测单 NVL144 机柜 1500-2100 万美元

原版 NVL144 机柜配置为 144 颗 Rubin Ultra GPU + 72 颗 Vera CPU,总显存 82.9 TB HBM4e,FP4 总算力推测约 14 EFLOPS,TDP 推测约 360kW——是 Vera Rubin NVL72(约 180kW)的整整一倍。

关键调整:4 芯片设计取消​

2026 年最重要的路线图变化,是据 SemiAnalysis 报道,原版 4 芯片 Rubin Ultra 设计因封装制造难度被取消,新版规模缩减约一半、性能相应减半,仅保留 2 芯片版本——规模扩展能力弱于原设计。站内芯片数据库也明确记录了这一调整。

与之相伴的是显存减配传闻:2026 年 9 月,SemiAnalysis 与科创板日报报道 Rubin Ultra 的 HBM 配置拟从 HBM4E 12-Hi(384GB 档)下调至 HBM4 8-Hi(192GB),三星配合开发 8 层产品。动因是 HBM/DRAM 涨价后内存已占整机 TCO 约 40%,减配后 HBM 成本可降超 50%;省下的预算转向 Scale-up 纵向扩展网络——以 NVL576 NPO 方案测算,Scale-up 网络占机架支出比例将从 4% 升至 12%。TrendForce 显示 NVIDIA 自 2026 Q3 起并行评估 HBM4E 8-Hi、HBM4E 12-Hi、HBM4 8-Hi 多套方案。

行业路线图口径:VR300 NVL576 与 Feynman​

行业路线图汇总口径(Thunder Compute,2026-10)给出了另一个观察视角,需注意与 GTC 2026 原版公布信息存在差异,最终以官方为准:

产品目标时间关键规格(行业口径)
Rubin Ultra VR3002027 H2100 PFLOPS FP4/GPU、1TB HBM4e、NVL576、机架约 600kW
Feynman2028规格未公布(preliminary/未确认)

这个口径下的 VR300 与站内数据库记录的原版 NVL144(576GB HBM4e/GPU)明显不同:单卡显存更高(1TB)、机柜规模更大(NVL576)、单机架功耗推高到约 600kW。两条信息线的分歧恰恰说明 Rubin Ultra 仍处于架构修订期,唯一确定的是方向——显存继续翻倍、机柜规模继续翻倍、功耗继续飙升。

一年一代:与客户 capex 的绑定节奏​

从 Hopper(2022)到 Blackwell(2024)再到 Rubin(2026),NVIDIA 已把旗舰产品节奏锁定为两年一代;而在同一代际内部,GB200→GB300 的中期升级又把"可买的最新品"刷新周期压缩到约一年。这种节奏对客户 capex 形成了强绑定:

  • 锁定采购:超大规模云厂商若想保持算力性价比领先,必须按 NVIDIA 的节奏滚动下单,否则两年后单位算力成本被拉开数倍;
  • 规划反推:Rubin Ultra 的 2027 H2 时间点,意味着客户 2026 年就要锁定机位、电力与液冷改造——约 600kW/机架的功耗口径直接改写数据中心设计规范;
  • 竞争挤压:AMD Helios II/MI500 同样瞄准 2027 年窗口,NVIDIA 把 Rubin Ultra 顶在 2027 H2,本质上是在客户年度预算分配前抢先占位。

HBM4e 供给与功耗:砍半的真实原因​

Rubin Ultra"砍半"并非技术退缩,而是三重现实约束的交汇:

  1. 封装良率:4 颗计算 die 的 MCM 封装对 CoWoS-L 工艺的良率要求过高,量产风险不可控;
  2. HBM 成本:内存占 TCO 40% 的现实下,576GB→192GB 档的减配能省下过半 HBM 预算;
  3. 功耗墙:原版 360kW 乃至行业口径 600kW 的机架功耗,正在逼近现有液冷基础设施与供电改造的承受极限。

省下的预算被重新分配给 Scale-up 网络——这透露出 NVIDIA 的判断:下一代旗舰的瓶颈不在单卡 FLOPS,而在机柜内纵向扩展的互联效率。光互联(NPO)进入 Scale-up 网络,就是这个判断的落地。

Feynman:2028 的悬念与命名暗示​

Feynman 目标 2028 年,目前规格完全未公布(preliminary/未确认)。但命名本身已传递信息——继以物理学家命名的传统(Fermi、Maxwell、Volta),Feynman(理查德·费曼)指向的是量子电动力学与路径积分的缔造者。行业普遍猜测其架构方向可能包括:更激进的近存计算、光子互联的规模化引入,以及面向 agentic AI 负载的原生优化。考虑到 NVIDIA 2026 年收购 Groq 后已在 LPU 架构上积累经验,Feynman 完全可能首次把"训练芯片"与"推理加速器"在架构层面统一调度。

不过需要冷静看待:NVIDIA 的公开路线图历来在临近发布时大幅修订,Feynman 的最终形态大概率与今天的任何猜测都不同。

与 AMD Helios II/MI500 的时间赛跑​

2027 年的正面交锋已经排定:AMD 的 Helios II 机架与 MI500 系列瞄准同一时间窗口。AMD 的打法是开放生态(UALink、开放 HBM4/4e 规格)+ 激进显存(延续 MI400 432GB HBM4 的堆料路线),而 NVIDIA 则以 NVLink 域规模与 CUDA 软件栈守正。Rubin Ultra 的架构修订,某种意义上正是对 AMD 显存策略的回应——当单卡显存竞争的成本效益递减时,把预算转向 Scale-up 网络与系统效率是更聪明的花法。

小结​

NVIDIA 2027-2028 路线图的核心叙事是"从堆规格到堆系统":Rubin Ultra 取消 4 芯片设计、显存减配、预算转向 Scale-up 光互联,是 HBM4e 供给与功耗现实下的理性选择;行业口径中 2027 H2 的 VR300 NVL576 与 2028 年的 Feynman,则勾勒出机架功耗迈向 600kW、架构走向异构统一的下一幕。对采购方而言,最重要的不是记住这些规格数字,而是理解一年一代节奏下"早买早享受、晚买享折扣"的 capex 决策模型正在失效——不跟上节奏,两年后的单位算力成本差距将大到无法用预算延迟来弥补。

统一内存大乱斗:128GB、192GB、748GB、288GB 谁才是最优解?

· 6 min read
Industry Research Team

2026 年秋天,"统一内存"成了 AI 硬件圈最卷的词。AMD 和 NVIDIA 在 AI PC 上贴身肉搏,桌面端堆出 748GB 的"超算",数据中心则用 HBM4 把带宽拉到 22TB/s。容量数字一路上涨,但真正决定体验的,是那个藏在参数表角落里的带宽。

统一内存要解决什么​

传统 PC 架构里,CPU 和 GPU 各管一摊内存:模型文件躺在系统内存里,推理前要先通过 PCIe"搬运"到显存,模型一大,加载时间以分钟计,显存不够还会溢出到磁盘。统一内存的思路是把这堵墙拆掉——CPU 和 GPU 共享同一块物理内存,模型加载变成一次指针映射,权重不用搬,KV Cache 也能被两个处理器同时访问。

AMD 用 VGM(可变显存滑块)实现这一点:Ryzen AI Max+ 395 的 128GB 内存里,最多 96GB 可划给 GPU 当显存;新的 Pro 495 则允许从 192GB 里划出 160GB。NVIDIA 的路线更彻底,RTX Spark 的 GB10 超级芯片通过 NVLink-C2C 让 Arm CPU 与 Blackwell GPU 直接共享 128GB LPDDR5X,地址空间完全一致。

四档产品对比表​

2026 年 10 月的市场上,统一内存产品已经拉开四个档次:

档位产品统一内存可分配给 GPU带宽定位
AI PC 旗舰NVIDIA RTX Spark(GB10)128GB LPDDR5X共享统一内存300GB/s笔记本/紧凑桌面,跑 120B 模型
AI PC 旗舰AMD Ryzen AI Max+ 395128GB LPDDR5X96GB(VGM)256GB/s端侧 70B 完整推理
AI PC 增配AMD Ryzen AI Max Pro 495192GB LPDDR5X160GB(VGM)约 272GB/s本地离线跑 100B 级模型
桌面超算DGX Station for Windows(GB300 Ultra)748GB(252GB HBM3e + 496GB LPDDR5X)一致性内存7.1TB/s(GPU 侧)万亿参数模型桌面开发
数据中心Rubin R200288GB HBM4全部显存22TB/s机架级训练与推理

值得注意的是两家新品发布的贴身节奏:AMD 在 10 月 5 日公布 Pro 495,两天后 NVIDIA 就办了 RTX Spark 新品活动。AMD 还准备了后续牌——代号 Gorgon Halo 的 Ryzen AI Max 400 同样最高 192GB,Pro 495 加速到 5.2GHz,并宣称是首款能在本地跑 300B 级模型的 x86 客户端处理器。整机侧,联想 YOGA Pro 15 搭载 RTX Spark,统一内存规格为 9400MT/s、256-bit 位宽。

带宽才是隐藏变量​

把四档产品的带宽排成一列,差距比容量悬殊得多:256GB/s(395)、约 272GB/s(Pro 495)、273GB/s(DGX Spark 64GB)、300GB/s(RTX Spark 128GB),再到 7.1TB/s 与 22TB/s——AI PC 与数据中心之间差了整整两个数量级以上。

这解释了一个反直觉的现象:容量相同的两台机器,token 生成速度可能差出数倍。大模型推理的 decode 阶段是典型带宽受限负载,每生成一个 token 都要把权重和 KV Cache 扫一遍,带宽直接决定每秒吐出多少字。RTX Spark 靠 300GB/s 在四款 AI PC 里领先;而 DGX Station 的 748GB 之所以值钱,不只因为容量能装下万亿参数,更因为 252GB HBM3e 提供的 7.1TB/s 带宽让模型真的跑得动,而不是"装得下、跑得慢"。

还有一档容易被忽略:DGX Spark 双机通过内置 ConnectX-7 的 QSFP 直连,可把内存池化到 128GB,模型上限提升至 2000 亿参数级,Qwen3.8 27B 实测峰值较单台提升最高 70%——用网络扩展统一内存,是介于单机和工作站之间的第三条路。

VGM 与 CUDA 统一内存的分配策略差异​

同样叫统一内存,AMD 和 NVIDIA 的分配哲学并不相同。AMD 的 VGM 是显式的静态划分:用户拖滑块决定划多少 GB 给 GPU,划出去的部分 CPU 不能再用。优点是行为可预测、显存语义清晰,对 llama.cpp、Stable Diffusion 这类工具友好;代价是弹性差,划多了浪费、划少了要重划。

NVIDIA 的 CUDA 统一内存是动态的:CPU 与 GPU 共享统一地址空间,按需在两者间迁移页面。开发者不用预判"该分多少",跑什么模型都是同一套逻辑;但页面迁移的粒度和时机由运行时控制,遇到突发访问模式时可能引入抖动。对追求开箱即用的消费用户,CUDA 路线体验更顺滑;对需要稳定显存预算的 Agentic 工作流,VGM 的确定性反而更吃香。

选型建议:按模型规模分档​

需求推荐档位理由
7B-30B 模型、日常 AgentRTX Spark / 锐龙 AI Max+ 395(128GB)容量富余,带宽 256-300GB/s 足够流畅
70B-100B 模型、隐私敏感锐龙 AI Max Pro 495(192GB / 160GB VGM)本地离线跑 100B 级,数据不出机
200B 模型、桌面开发双机 DGX Spark(池化 128GB)ConnectX-7 直连扩展,成本低于工作站
万亿参数、专业工作流DGX Station(748GB)HBM3e 带宽保证可用性
生产级服务Rubin R200(288GB HBM4 / 22TB/s)机架级并发与吞吐

小结​

统一内存之战没有单一最优解:128GB 与 192GB 争夺 AI PC 入场券,748GB 的 DGX Station 把数据中心内存架构搬上桌面,288GB HBM4 则继续守卫机架级吞吐。选型的第一变量不是容量,而是带宽——256GB/s 与 22TB/s 之间隔着三个数量级的体验鸿沟;第二变量是分配策略——VGM 的确定性划分与 CUDA 的动态迁移各有适配场景。先想清楚要跑多大的模型、多少并发,再看参数表,才不会被大数字带偏。

Vera CPU 深度:SCF + 1.5TB LPDDR5X,NVIDIA 自研 CPU 的野心

· 7 min read
Industry Research Team

当所有人盯着 Rubin R200 的 50 PFLOPS FP4 时,真正决定这台机器推理经济性的,可能是一颗 CPU。Vera——NVIDIA 首次全面自研核心的数据中心 CPU,用 88 个 Olympus 核心、第二代 SCF 一致性结构和 1.5TB LPDDR5X,重新定义了"AI 工厂的主机处理器"。本文依据站内芯片数据库与智能体基准实测,拆解 NVIDIA 从外购 Arm 核到自研 SCF 的演进逻辑。

从 Grace 到 Vera:自研之路的三级跳​

NVIDIA 的 CPU 战略经历了三个阶段:GH200/GB200 时代的 Grace CPU 基于 72 核 Neoverse V2 公版 Arm 核心,本质是"外购核心 + 自研互联";GB300 延续了这一代 Grace;而 2026 年 GTC 发布的 Vera 则完成质变——核心、片上互连、内存子系统全部自研。据站内芯片数据库,Vera 的核心规格如下:

规格参数
CPU 架构ARM 架构(自研 Olympus 核心)
指令集ARMv9.2(完全兼容)
核心数量88 个 Olympus 核心
线程数量176 个线程(空间多线程)
单核性能前代产品的 2 倍
最大内存容量1.5 TB(LPDDR5X)
内存带宽1.2 TB/s
互联技术NVLink-C2C(1.8 TB/s)
片上互连第二代 SCF(3.4 TB/s 对分带宽)
发布时间2026 年 3 月 17 日
量产时间2026 年下半年

SCF:88 核无延迟扩展的底座​

SCF(Scalable Coherency Fabric,可扩展一致性结构)是 Vera 最值得细看的技术。第二代 SCF 提供 3.4 TB/s 对分带宽,采用片上网格 + 统一缓存设计,可无延迟扩展 88 个核心。

对分带宽(bisection bandwidth)是衡量片上互连质量的关键指标:它表示把芯片切成两半时,两半之间的总通信带宽。88 核的大芯片如果对分带宽不足,核心越多内耗越大。第二代 SCF 用网格拓扑让任意核心间的通信路径趋于均匀,配合统一缓存避免一致性流量的长距离穿梭——这正是 Vera 敢于采用单体计算芯片设计(而非多小芯片拼接)的底气:避免跨小芯片通信延迟,在所有核心满载时保持稳定延迟和吞吐量,性能可预测性强。

1.5TB LPDDR5X:把内存子系统当主武器​

Vera 将 SCF 与高达 1.5TB 的 LPDDR5X 内存子系统结合。对比上一代 Grace 的规格变化一目了然:

指标Grace(GB200/GB300)Vera提升
内存容量480GB LPDDR5X最高 1.5TB LPDDR5X约 3 倍
内存带宽512 GB/s1.2 TB/s约 2.3 倍
CPU-GPU 互联NV-HBI 900 GB/sNVLink-C2C 1.8 TB/s2 倍
核心数72 核 Neoverse V288 核 Olympus+22%

更关键的是系统级设计:LPDDR5X 与 GPU 的 HBM4 可视为单一一致性内存池。这意味着数据不再需要在"CPU 内存"和"显存"之间显式搬运,两个物理上分离的内存子系统在软件视角下是一体的。对推理业务,这带来两个直接收益:KV 缓存卸载——不常用的注意力上下文可以下沉到 LPDDR5X 侧,把昂贵的 HBM4 带宽留给热点数据;多模型高效执行——多个模型实例共享同一内存池,切换与加载开销大幅降低。

Daytona 实测:智能体时代的 CPU 门槛​

2026 年 10 月 10 日公布的 Daytona 智能体基准测试,给 Vera 的实际能力提供了量化注脚。智能体负载的特点是海量并发沙盒的创建与销毁——恰恰考验 CPU 的内存容量、一致性与调度效率:

测试项VeraAMD EPYC 9755差距
1000 沙盒上线10.8 秒88.4 秒约 8 倍
峰值智能体任务吞吐13.3 任务/秒——
2000 沙盒上线27.4 秒——

8 倍的沙盒上线速度差距说明:智能体负载对 CPU 的要求已与通用计算分道扬镳——容量大(1.5TB 装下海量沙盒状态)、带宽高(1.2TB/s 喂饱并发)、一致性结构强(88 核高效协作)。站内芯片数据库同时记录,Vera 的软件环境运行速度相比传统架构 CPU 提升最高 50%,满负载下强化学习评估周期可缩短 50%。

与 Groq 3 LPX 的异构分工​

Vera 所在的 Rubin 平台还有一位非常规队友:NVIDIA 收购 Groq 后推出的 Groq 3 LPX。据站内芯片数据库,LPX 机架集成 256 颗 LPU,聚合 128GB 片上 SRAM,聚合带宽高达 40 PB/s,官方口径的能效优势显著(35× perf/W vs H100 推理)。在 Rubin 平台的分工中,GPU 承担训练与 prefill,Groq 3 LPX 专攻智能体解码阶段的低延迟输出——而 Vera 则是这一切的调度中枢。prefill 吃算力、decode 吃带宽、调度吃一致性与容量,三种负载由三种架构分别消化,这正是"每 token 经济学"推导出的异构架构必然性。

Vera vs EPYC Venice:服务器 CPU 的新战场​

Vera 的出现让 NVIDIA 与 AMD 在服务器 CPU 领域正面相遇。据站内芯片数据库,AMD EPYC Venice(2026 CES 发布)是全球首款 2nm 数据中心 CPU:

指标NVIDIA VeraAMD EPYC Venice(Zen 6C)
核心88 个自研 Olympus最多 256 个 Zen 6C
制程未公开台积电 2nm(N2)
内存1.5TB LPDDR5X16 通道 DDR5
单路带宽1.2 TB/s1.6 TB/s
L3 缓存—1GB
卖点NVLink-C2C、CPU-GPU 一致性通用性、x86 生态

两者的定位差异明显:EPYC Venice 是通用数据中心 CPU 的极致(256 核、x86 生态、Helios 机架中与 MI455X 组队),而 Vera 是 AI 专用 CPU——它不做通用服务器生意,只为 AI 工厂的主机负载优化。Vera 甚至支持硬件级 FP8 计算,是全球首款支持 FP8 精度的 CPU,并支持全机密计算的硬件级安全隔离。竞争的天平取决于一个问题:AI 工厂的 CPU 采购,会不会整体从通用服务器预算中剥离?如果会,Vera 绑定 Rubin GPU 的销售模式将是护城河;如果不会,EPYC 的生态广度仍难撼动。

小结​

Vera CPU 标志着 NVIDIA 完成了从"用别人的核心攒超级芯片"到"自研全套主机平台"的跃迁:SCF 的 3.4TB/s 对分带宽解决了 88 核扩展难题,1.5TB LPDDR5X 与 HBM4 构成的一致性内存池重构了推理数据流,Daytona 实测的 8 倍沙盒优势则证明智能体负载确实需要一颗不一样的 CPU。它的野心不在挑战 x86 的通用服务器王座,而是重新划定一条边界——AI 基础设施中,CPU 是 GPU 子系统的一部分,而不是独立采购的商品。这条边界能否成立,将决定未来五年服务器市场的版图。

定制HBM军备赛:AWS联手NVIDIA开发NVHBM,超大规模厂商开始"造内存"

· 5 min read
Industry Research Team

当芯片厂商开始"造内存"、云厂商开始"造芯片",AI基础设施的分工边界正在瓦解——存储不再是采购来的标准件,而是与加速器协同设计的战略资产。

NVHBM:AWS与NVIDIA的定制内存联姻​

AI Infra Summit 2026(9月17日)上爆出的消息显示:亚马逊旗下Annapurna Labs正与NVIDIA合作开发NVHBM定制高带宽内存技术。

这个组合本身就足以说明问题。Annapurna Labs是AWS自研芯片体系的核心(Graviton CPU、Trainium/Inferentia加速器都出自该团队),而NVIDIA则是AI加速器绝对主导者。两家联手开发定制HBM,意味着最强势的云厂商与最强势的芯片厂商决定共同绕开标准内存路线,为AI负载打造私有化的内存方案。

存储协同设计:行业范式转移​

NVHBM并非孤立事件。AI Infra Summit 2026前后,存储行业的密集动作勾勒出一幅"存储深度嵌入AI"的图景:

厂商时间动作关键内容
亚马逊+NVIDIA9月17日报道合作开发NVHBM定制高带宽内存
SK海力士9月17日发布"New Spectrum"组合HBF高带宽闪存、PIM存内计算、eSSD、SALT-KV
SK海力士9月18日成立SK hynix Ventures(硅谷)拓展全球AI生态投资
美光9月15日超密度服务器内存模组全球首款

2026年9月21日的半导体周报对这一趋势给出了精辟概括:"Memory is being co-designed with AI accelerators rather than treated as a commodity"——内存正在与AI加速器协同设计,而不再被视为大宗商品。

这句话宣告了一个时代的结束:过去几十年,内存是标准化的商品,JEDEC规范统一接口,谁家买都一样。而在AI时代,内存的带宽、容量、拓扑直接决定集群效率,"标准件"思维已经跟不上需求。

为什么绕过JEDEC走定制路线​

超大规模厂商选择定制HBM,动机有三:

  • 性能天花板:标准HBM的规格迭代节奏由JEDEC委员会决定,而AI负载的内存需求以年为单位翻倍。定制方案可以围绕特定加速器优化堆栈数、接口带宽和容量配比,榨取最大能效。
  • 供应安全:HBM产能持续紧张,已成为整个AI芯片产业的瓶颈。定制协议绑定的不只是技术规格,更是产能分配——把内存供应商变成深度盟友。
  • 成本控制:HBM占AI加速器物料成本的重要比重。云厂商自建芯片团队后,有动力也有能力参与内存定义,消除中间层的规格冗余。

HBM短缺:国产芯片涨价潮的根源​

定制HBM军备赛的另一面,是HBM产能的普遍短缺。近期的国产芯片涨价潮,其根源正是HBM供应不足——当NVIDIA、AMD以及各云厂商自研芯片都在争夺有限的HBM产能时,位于优先级末端的采购方(包括部分国产AI芯片厂商)面临的是"有芯片设计、没有内存可用"的窘境,成本随之水涨船高。

这解释了为什么HBM产能与成本已成为芯片厂商的核心竞争维度:谁能锁定HBM供应,谁就能锁定出货量;谁的定制内存方案能效更高,谁的产品就更具竞争力。存储厂商的地位因此空前提升——SK海力士在发布"New Spectrum"后次日即于硅谷设立SK hynix Ventures投资AI生态,正是从供应商向生态节点跃迁的标志性动作。

对下一代平台意味着什么​

NVHBM若落地,影响将体现在两个层面:

  • NVIDIA Vera Rubin及后续代际:定制内存与加速器协同设计,意味着未来Rubin后续产品的内存子系统可能针对AWS负载定制,云厂商对芯片平台的参与度从"采购方"升级为"共同定义方"。
  • 机架级内存竞赛:AMD已展示31TB HBM4机架方案,机架级内存容量的军备竞赛已经开打。当内存容量从单卡432GB演进到机架数十TB,内存架构的设计自由度(定制HBM vs 标准HBM4)将直接决定产品竞争力。

小结​

AWS联手NVIDIA开发NVHBM,标志着存储正式从"采购关系"进入"协同设计"时代:SK海力士以HBF/PIM/eSSD/SALT-KV重构存储产品线并设立风投部门,美光推出超密度内存模组,超大规模厂商开始绕过JEDEC定制内存。HBM短缺引发的国产芯片涨价潮则揭示了新秩序的残酷一面——内存即产能,产能即话语权。当"造内存"成为芯片巨头的必修课,AI基础设施的竞争维度被彻底改写。

SK海力士发布AI存储"新频谱":HBF、PIM、SALT-KV重新定义AI基础设施

· 5 min read
Industry Research Team

2026年9月17日,SK海力士在AI Infra Summit 2026上发布面向AI基础设施的"New Spectrum"技术组合。当Agentic AI与长上下文推理把存储推向瓶颈中心,存储厂商正从部件供应商转型为AI基础设施平台玩家。

New Spectrum:四大技术方向​

SK海力士此次发布的"New Spectrum"组合覆盖四个方向,每一项都瞄准AI工作负载中最突出的存储瓶颈:

技术方向全称核心定位
HBFHigh Bandwidth Flash(高带宽闪存)把闪存带宽提升至内存量级
PIMProcessing In-Memory(存内计算)在存储侧完成计算,减少数据搬运
eSSD企业级固态硬盘AI数据湖与训练数据底座
SALT-KV—面向KV Cache的键值存储方案

这四项技术的共同指向非常清晰:AI推理时代的存储不再是"够大就行",而是要同时满足带宽、容量、成本与数据通路效率的多重约束。

KV Cache经济性:Agentic AI拉动的存储需求​

理解New Spectrum的关键,是理解KV Cache经济性。

大语言模型推理时,每一个token的生成都要读取之前所有上下文的KV Cache。上下文越长,KV Cache越大;Agentic AI的兴起让"长对话、多轮次、多Agent协作"成为常态——一个Agent任务可能持续数十轮调用,每轮都在累积上下文。这意味着:

  • KV Cache容量需求爆炸式增长:长上下文模型动辄数十万token的窗口,单请求KV Cache可达数十GB量级;
  • 带宽成为隐性成本中心:每生成一个token都要完整读取KV Cache,内存带宽直接决定了单位token成本;
  • 层级化存储成为必然:HBM放不下的KV Cache需要更快的次级存储,这正是HBF与SALT-KV的切入点。

同期,华为OceanStor M900已提供PB级KV Cache集群方案,说明"KV Cache基础设施化"已是行业共识。谁能把KV Cache存得更多、读得更快、成本压得更低,谁就掌握了推理经济的新杠杆。

HBF:把闪存带宽提到内存量级​

HBF(High Bandwidth Flash)是New Spectrum中最具想象空间的一项。传统NAND闪存的致命短板是带宽——顺序读尚可,随机读性能与内存相差数个量级,因此长期只能承担"冷数据"角色。

HBF借鉴HBM的设计哲学,通过堆叠与宽接口把闪存带宽提升至接近内存的量级。这带来的可能性是:原本必须驻留HBM的热数据,可以部分下沉到HBF层,在成本几乎不变的情况下大幅扩展"有效内存容量"。对于动辄以TB计的模型权重和KV Cache而言,HBF有望成为HBM与eSSD之间缺失的中间层。

PIM:推理场景的近数据计算​

PIM(存内计算)的定位则是解决另一个痛点:数据搬运。在传统架构中,数据从内存搬运到计算单元的能耗与延迟开销,往往超过计算本身。PIM把计算能力直接嵌入存储介质,让"数据不动、计算过来"。

在推理场景中,PIM尤其适合权重固定的矩阵乘加等访存密集操作,能够在降低功耗的同时提升吞吐。随着每瓦token数成为数据中心的核心KPI,PIM的价值会持续放大。

行业同期动作:存储军备竞赛全面展开​

SK海力士的动作并非孤立。2026年9月中旬,存储与定制硬件领域密集出招:

时间厂商动作
9月15日美光发布全球首款超密度服务器内存模组
9月17日SK海力士AI Infra Summit 2026发布New Spectrum技术组合
9月18日SK海力士在硅谷成立SK hynix Ventures,扩大全球AI生态投资
9月同期亚马逊Annapurna Labs × NVIDIA合作NVHBM定制HBM

三个信号值得注意:其一,美光的超密度内存模组直指单机内存容量天花板;其二,亚马逊与NVIDIA的NVHBM合作说明头部应用方已深入定制内存控制器层面;其三,SK hynix Ventures落地硅谷,表明存储巨头不再满足于卖部件,而是要通过投资生态锁定AI基础设施的平台位置。

2026年9月的半导体周报对此有明确判断:存储正与AI加速器协同设计,存储公司正从部件供应商转型为AI基础设施平台玩家。HBM4时代的定制化(如NVHBM)正是协同设计趋势的直接体现——内存不再是可以即插即用的标准件,而是与GPU、ASIC深度耦合的系统组件。

小结​

SK海力士的New Spectrum组合——HBF、PIM、eSSD、SALT-KV——勾勒出AI存储的完整路线图:HBF把闪存带宽提到内存量级、填补HBM之下的层级空白,PIM用近数据计算降低搬运开销,SALT-KV直击KV Cache经济性这一推理时代的核心命题。叠加美光超密度内存、亚马逊与NVIDIA的NVHBM定制HBM等同期动作,2026年的存储行业已经清晰地完成了角色转身:从跟随GPU节奏的部件供应商,变成与AI加速器协同设计、共同定义AI基础设施形态的平台玩家。存储,正在成为AI竞争的下一个主战场。

2nm时代开启:AMD MI455X成首款TSMC N2 AI GPU,三星/台积电2027量产竞速

· 5 min read
Industry Research Team

2nm不再只是制程路线图上的一个名词,它已经成为AI算力竞赛的物理基础。AMD MI455X的问世,宣告最先进制程正式进入AI加速器的主战场。

MI455X:首款N2制程AI GPU登场​

2026年7月23日,AMD在Advancing AI活动中正式发布基于CDNA 5架构的MI455X。而在Hot Chips 2026上,AMD首次公开了这款芯片的chiplet级细节,其中最重磅的信息是:8个加速复杂裸片(XCD)采用台积电N2(2nm)制程制造,这使MI455X成为业界首款采用N2的AI GPU。

N2是台积电首个量产的2nm节点,也是其首次在逻辑制程中采用GAA环绕栅极晶体管的第二代演进。把旗舰AI加速器的主力计算裸片押注在新节点上,AMD对2nm良率与产能的信心可见一斑。

Chiplet架构深度解析​

MI455X的架构设计体现了"异构集成极致化"的思路:

部件制程/规格关键参数
8个XCD计算裸片台积电N2(2nm)3D混合键合(Hybrid Bonding)堆叠
Fabric/Cache/IO裸片台积电N3P承担互连、缓存与外围功能
封装CoWoS-L台积电先进封装
晶体管总数—3200亿
HBM412个堆栈432GB、23.3TB/s带宽
全局L2缓存—192MB

几个值得注意的设计选择:

  • 3D混合键合:8个XCD不再仅靠2.5D互连并排摆放,而是通过3D混合键合垂直堆叠集成,大幅缩短裸片间信号路径、提升互连密度。
  • 制程分工:计算裸片用最先进的N2追求性能与能效,而fabric/cache/IO裸片采用更成熟、成本更低的N3P——这是chiplet时代"好钢用在刀刃上"的典型做法。

内存与算力:对MI355X的代际跃升​

对比上一代MI355X,MI455X在内存和算力两个维度都实现了跨越:

指标MI355X(HBM3E)MI455X(HBM4)提升幅度
显存容量288GB432GB1.5倍
总带宽—23.3TB/s约2.9倍
MXFP4算力—40.26 PFLOPS4倍
MXFP6/MXFP8算力—各20.13 PFLOPS—

低精度数据格式的全面支持是CDNA 5的重点:MXFP4算力达到MI355X的4倍,直接面向当前主流的大模型FP4推理与训练场景。

架构演进:Wave32、超越函数引擎与数据搬运器​

除了制程和规格,MI455X在微架构层面有三处关键改动:

  1. 原生Wave32执行:从传统Wave64转向原生Wave32,降低指令延迟与寄存器压力,让SIMD单元利用率更高,尤其利于注意力机制等不规则计算负载。
  2. 超越函数引擎:新增专用引擎加速attention中的数学运算(如指数、归一化等超越函数),直击Transformer推理的热点。
  3. Tensor Data Mover:专门的数据搬运单元,减少计算单元在数据调度上的空转,提高实际有效算力占比。

这三项改动共同指向一个目标:让纸面PFLOPS尽可能转化为真实吞吐。

2nm量产竞速:台积电、三星与Intel的三角格局​

MI455X只是2nm竞赛的开局。2026年9月的报道显示,三星正联合台积电推进2nm AI芯片制程,目标2027年量产,能效比提升40%。两大代工厂不约而同地把2nm的市场切入点选在AI芯片上——因为只有AI客户能承受先进制程的晶圆成本,也只有AI负载能把每瓦性能的价值放大到极致。

另一边,Intel Foundry的High NA EUV已累计处理超过100万片晶圆(截至2026年9月21日当周的报道),在1.4nm及以下节点上,Intel试图用High NA EUV实现技术反超。代工三强的2nm/1.4nm竞速,本质上是在为2027年之后的AI芯片订单排兵布阵。

能效比:下一个主战场​

为什么整个行业都在押注2nm?答案不是峰值算力,而是能效比。当单个训练集群的功耗达到数百兆瓦时,制程每提升一代带来的每瓦性能改善,会直接折算成电力基建成本和运营费用的下降——这正是前文所述"算力竞赛变成电力竞赛"的技术呼应。三星与台积电宣传的"能效比提升40%",对应的正是客户最痛的那根神经。

小结​

MI455X用8个N2制程XCD、3D混合键合、3200亿晶体管和432GB HBM4,把AI GPU的工程上限推到了新高度;而Wave32原生执行、超越函数引擎和Tensor Data Mover则展示了微架构层面让算力"落地"的努力。随着三星/台积电剑指2027年2nm量产、Intel以High NA EUV蓄力,先进制程与AI算力已经深度捆绑。2nm时代的开启意味着:未来AI芯片的竞争,将在原子尺度上决出胜负。

AI Cluster Power Crisis: 1MW Racks, Nuclear Plants, SMRs, and Green AI

· 8 min read
Industry Research Team

In 2026, AI compute growth has hit a hard constraint — electric power. With NVIDIA Rubin NVL576 single-rack power consumption at 1 MW, the xAI Colossus cluster at 200 MW, and OpenAI's planned Stargate campus at 5 GW, power supply is becoming the biggest bottleneck for AI development. This article provides an in-depth analysis of this "power crisis" and the solutions.