跳到主要内容

11 篇博文 含有标签「Roadmap」

Vendor AI chip roadmap updates and forecasts

查看所有标签

2027 AI 芯片前瞻:Rubin Ultra、Helios II、昇腾970 与真武量产元年

· 阅读需 6 分钟
Industry Research Team

2026年即将收官,各大厂商的2027年路线图已经基本清晰:NVIDIA 的 Rubin Ultra、AMD 的 Helios 后继、华为的一年一代、平头哥的真武上云,四条主线同时压向2027。本文基于站内规格卡与公开排期信息,梳理2027年的关键时间节点、供给端风险与采购建议。

2027 四大主线时间线​

时间NVIDIAAMD华为昇腾阿里平头哥
2027 Q1Rubin R200 规模爬坡MI455X/MI430X 持续放量960DT 提前就绪真武 V900 量产上云
2027 Q2——960DT 上市(Atlas 860 风冷超节点)倚天 720/730 路线推进
2027 H2Rubin Ultra 目标量产Helios II/MI500 级待公布960PR 上市(Q3,Atlas 960 液冷)J900 排期 2027 Q3
2028+Feynman(2028 预告)Verano CPU 预研昇腾 970(官宣)—

主线一:NVIDIA Rubin Ultra 与 Feynman​

站内规格卡记录了 Rubin Ultra(V300)的原版口径:GTC 2026 公布,原版 4 芯片 MCM 设计、单卡 576GB HBM4e、NVL144 机柜、FP4 算力推测约 100 PFLOPS、机柜 TDP 推测约 360kW、量产时间推测 2027 H2–2028。需要注意的是,2026 年 9 月 SemiAnalysis 与科创板日报报道该原版 4 芯片设计已取消、显存拟从 HBM4E 12-Hi(384GB 档)下调至 HBM4 8-Hi(192GB),省下的预算转向 Scale-up 纵向扩展网络。

补充素材口径则给出另一套机架级目标:Rubin Ultra VR300 NVL576 目标 2027 H2,单 GPU 100 PFLOPS FP4、1TB HBM4e、机架功耗约 600kW。两种口径并存——原版 NVL144/576GB 与修订后 NVL576/大机架路线——最终规格以 NVIDIA 官方确认为准,但无论哪个版本,2027 H2 都是多方面向的交付大考。更远处,Feynman 架构已预告 2028 年登场。

主线二:AMD Helios 需求超预期与 MI500 预研​

站内 MI500 规格卡显示:CDNA 6 架构、TSMC 2nm 制程、HBM4E 显存,预计 2027 年发布,由 AMD 与 OpenAI 联合定义开发,目标较 MI300X 实现四年千倍级 AI 性能跃升。补充素材方面,AMD 公开口径称 Helios 需求超出预期,未来 3-5 年有大幅增产计划;MI430X 将驱动 LUMI-AI 超算;Verano CPU 处于预研阶段。对 2027 年而言,AMD 的关键不是发布新品,而是把 MI455X/Helios 的量产爬坡走完,为 MI500 接棒铺路。

主线三:华为一年一代,970/980 已排期​

站内昇腾 960 规格卡给出的信息量很大:960DT 较原计划提前三个季度就绪(2027 Q1)、2027 Q2 上市;960PR 提前一个季度、2027 Q3 上市。配套的昇腾 960 超节点是全球首个 NPO(近封装光学)超节点,单节点 4096 卡、8 EFLOPS FP8、1PB HBM。华为同步确认一年一代节奏:2028 年昇腾 970、2029 年昇腾 980,访存带宽/容量/互联带宽同步大幅提升。960DT 提前三季就绪这一细节尤其值得注意——它说明国产供应链(自研 HBM、SMIC 产能)的排期确定性在增强。

主线四:真武量产元年与 OpenAI 自研芯片​

平头哥真武 V900 在 2026 云栖大会亮相后,排期 2027 Q1 量产并上云,216GB 显存、1200GB/s 带宽的配置让它成为国产推理芯片里最受关注的旗舰之一;倚天 720/730 CPU 路线同样指向 2027,J900 排期 2027 Q3。国际侧,OpenAI 的 Jalapeño 自研芯片计划推进多吉瓦(multi-gigawatt)部署,与博通的 10GW 协议仍在推进中。端侧方面,N1X/RTX Spark 生态在 2026 年秋季落地之后,2027 年大概率迎来第二代产品换代的窗口。

谁会最先卡在供给端​

2027 年最大的不确定性不在芯片设计,而在供给端三座大山:

约束现状(公开口径)影响对象
HBM 供给头部厂商 HBM 产能已被预订至 2029所有依赖外购 HBM 的厂商;华为以自研 HBM 对冲
电力单机架功耗迈向 600kW,数据中心排队等电Rubin Ultra NVL576 等大机架方案
出口管制先进制程与高端芯片管制持续国产厂商先进制程产能

HBM 是最紧的一环:内存占整机 TCO 比重已升至约 40%,Rubin Ultra 减配 HBM 的传闻正是这一矛盾的直接体现。电力则是第二约束——当单机架功耗从 GB300 的约 140kW 走向 Rubin Ultra 时代的 600kW,"有没有电"会取代"有没有卡"成为招标的第一问。出口管制的变量则决定了国产芯片的产能天花板与替代节奏。

对采购方的提前量建议​

基于上述排期,给计划在 2027 年部署算力的团队三条建议:

  1. 提前 2-3 个季度锁货。HBM 售罄至 2029 的背景下,2027 H2 交付的 Rubin Ultra、MI500 级产品,其 2027 Q3-Q4 的配额大概率在 2026 年底至 2027 年初就被超大规模客户预订。等发布再下单,等于排在队尾。
  2. 双轨评估。2027 年是国产芯片真正"全代际交付"的第一年(960DT/960PR、真武 V900 同时到位),预算充裕且受合规约束的团队应同时评估 NVIDIA/AMD 路线与昇腾/平头哥路线的交付确定性,而不是只看单卡性能表。
  3. 把电力写进合同前置条件。机架功耗从 200kW 级迈向 600kW 级的过程中,供电改造周期往往比芯片交付周期更长,选址与电力协议应先于芯片采购启动。

小结​

2027 年的 AI 芯片市场将是"四线并进"的一年:NVIDIA 用 Rubin Ultra 冲击大机架时代、AMD 从 Helios 走向 MI500、华为兑现一年一代的承诺、平头哥迎来真武量产元年。所有路线图的共同瓶颈是 HBM、电力与出口管制三座大山——芯片厂商比拼的不再只是架构,而是供应链与能源的掌控力。对采购方而言,2027 年的胜负手在 2026 年底就已决定:提前锁货、双轨评估、电力先行。

边缘 AI 芯片全景:从 DGX Spark 到具身智能的算力下沉

· 阅读需 6 分钟
Industry Research Team

2026年10月,边缘 AI 迎来了标志性的一周:NVIDIA DGX Spark 正式发布、RTX Spark 笔记本预订开启、AMD Gorgon Halo 亮出 192GB 统一内存、微软与联想的新机同日开售。算力正在从数据中心向 PC、桌面和机器人急剧下沉。本文梳理边缘算力金字塔的完整版图。

边缘算力金字塔​

边缘 AI 不是一个市场,而是四层结构分明的金字塔:

层级典型芯片算力区间典型场景
手机 NPU骁龙/天玑/麒麟 NPU数十 TOPS拍照增强、语音助手、实时翻译
AI PCRTX Spark、Ryzen AI Max、Core Ultra 2100-1000+ TOPS(AI 总算力)本地大模型、创作 Copilot
桌面超算DGX Spark/Station、GB3001-20 PFLOPS FP4百亿至万亿参数本地推理
数据中心Rubin R200、MI455X、昇腾950EFLOPS 级前沿模型训练与超大规模推理

站内规格卡可以精确刻画中间两层。AI PC 层:NVIDIA RTX Spark 采用 Arm CPU + Blackwell GPU 统一内存架构,最多 20 核 Arm、6144 CUDA 核心、128GB LPDDR5X、带宽 300GB/s,AI 算力 1 PFLOPS FP4(稀疏,官方口径),可运行 1200 亿参数模型与 100 万 token 上下文;AMD Ryzen AI Max+ 395(Strix Halo)为 16 核 Zen 5 + 40 CU RDNA 3.5 + XDNA 2 NPU 50 TOPS,128GB UMA 中 96GB 可分配给 GPU,端侧可跑 70B 模型;Intel Core Ultra Series 2(Lunar Lake)NPU 4.0 达 48 TOPS,是全球首款满足 Copilot+ PC 标准的 x86 芯片。

桌面超算层:DGX Spark 64GB 售价 $4,999,2026 年 10 月 23 日起经宏碁、华硕、戴尔等 OEM 开售,单机可流畅运行千亿参数模型;两台 Spark 通过 ConnectX-7 直连后内存池化至 128GB,模型上限提升至 2000 亿参数级,双机集群实测较单台 128GB 系统峰值最高提升 70%。更上层的 DGX Station for Windows 搭载 GB300、748GB 统一内存(252GB HBM3e + 496GB LPDDR5X)、20 PFLOPS FP4,2026 Q4 上市,把桌面推到了接近数据中心的量级。

新机潮:一周之内的三家对决​

2026 年 10 月上旬,边缘 AI 设备密集落地。微软 Surface Laptop Ultra 定价 $2,599,官方口径 AI 性能达竞品 Mac 的 2 倍、视频场景 6 倍,10 月 16 日发货;联想 YOGA Pro 15 RTX Spark 同日开售,预装天禧 AI 35B 本地模型,已有 100 余款软件完成适配;NVIDIA RTX Spark 笔记本预订同步开启,首发 OEM 覆盖 Dell、HP、Lenovo、Asus、MSI 等 8 家厂商,形态包括 30 余款笔记本与约 10 款桌面。

AMD 的回应是 Gorgon Halo:Ryzen AI Max 400 系列(Pro 495/490/485)最高 192GB 统一内存,通过 VGM 可变显存最多将 160GB 划给 GPU,单机离线运行 1000 亿参数级大模型——按官方口径可支持 300B 级模型的本地量化部署。它的差异化卖点是原生 x86、无模拟层,避开 Arm 方案在 Windows 上的 Prism 转译开销。

本地大模型的隐私经济学​

边缘算力下沉的驱动力不只是性能,还有隐私与成本的双重账本。站内 Ryzen AI Max Pro 495 规格卡记录了一个典型案例:艾美奖获奖 VR 工作室 LightSail VR 在锐龙 AI Max 桌面机上搭建"制作协调员" AI Agent,同时管理 6-9 个制作项目,相当于过去 2 个人力的工作量;由于全部本地运行,云费用为零,同样的工作量放云端每月 token 费用要数千美元。

这笔账可以推广:当一台 $4,999 的 DGX Spark 或一台 Pro 495 工作站能够离线承载千亿参数模型,敏感数据(报税文件、医疗记录、未发布的设计稿)不再需要上传云端,企业同时获得隐私合规与可预测的成本结构。本地 Agent 的边际成本趋近于零,这是云 API 定价模型无法做到的。

具身智能:边缘算力的第二战场​

机器人是 2026 年边缘 AI 最陡峭的增长曲线。国内动态方面,江苏昆山张浦一次性发布 12 款具身智能产品,覆盖轮足巡检、重载作业等场景,具身智能正从展会样机走向批量交付。海外方面,通用机器人大脑公司 FieldAI 完成 7 亿美元融资,估值达 100 亿美元,资本对"机器人的 GPT 时刻"下注明显。

NVIDIA 自己也在用机器人造机器人:其西雅图机器人实验室以 Flexiv Rizon 4S 协作臂搭配 UR10e,配合视觉-语言-动作(VLA)管线,实现了 GB300 测试托盘装配的自动化,官方口径成功率 95%。这个案例的意义在于示范了完整的机器人技能习得闭环——感知、决策、执行全部在端侧算力上运行。

具身智能对边缘芯片提出了 AI PC 完全不同的需求:低时延控制回路(毫秒级)、多模态感知融合、以及抗震动宽温的工业可靠性。这将是未来 2-3 年边缘芯片的第二增长极。

边缘-云协同架构​

金字塔的各层不是替代关系,而是协同关系。当前主流的分工模式是:云端完成模型训练与大规模推理(Rubin R200、MI455X 的主场),桌面超算承担本地 Agent 的常驻推理(DGX Spark/Station),AI PC 处理隐私敏感的个性化任务(RTX Spark、Ryzen AI Max),手机 NPU 兜底最高频的轻量推理。数据在层间按敏感度与时效性分流:原始数据尽量不出端,模型权重与更新从云端向下推送。

对开发者而言,这意味着一套模型需要在四层硬件上都有高效的运行时——从 CUDA 到 ROCm、从 ONNX 到各厂商 NPU SDK,跨平台部署能力正在取代单点性能成为边缘 AI 工程的核心竞争力。

小结​

2026 年 10 月的这波新品潮,标志着边缘 AI 完成了从"能跑 demo"到"能干活"的跨越:DGX Spark 把千亿美元参数级推理装进机顶盒大小的机身,Gorgon Halo 用 192GB 内存重新定义 AI PC 的上限,具身智能则把边缘算力推向了物理世界。边缘算力金字塔的四层结构已经成型,接下来的竞争焦点将从单机性能转向边缘-云协同的系统能力——谁能把算力放到离数据最近的地方,谁就赢得下一代 AI 交互的入口。

Intel AI 芯片十字路口:Gaudi 系列承压、Jaguar Shores 待发、Crescent Island 补位

· 阅读需 7 分钟
Industry Research Team

2026 年的 Intel 呈现出一种罕见的矛盾景象:一边是 x86 服务器 CPU 持续丢失份额、却在 10 月 5 日启动年内第三次涨价(涨幅 10%);另一边是 AI 加速器产品线在 Falcon Shores 取消后重组为"Gaudi 现役 + Jaguar Shores 待发 + Crescent Island 补位"的三层结构。这家 x86 巨头正站在 AI 芯片战略的十字路口,每一步选择都关乎未来十年的市场地位。

现役主力:Gaudi 3 与承压中的 Gaudi 4​

根据站内芯片卡数据,Gaudi 产品线的演进脉络清晰可见:

产品发布时间制程显存FP8 算力TDP状态
Gaudi 12019-Q328nm 级32GB HBM2——EOL
Gaudi 22022-Q37nm96GB HBM2E—600WEOL
Gaudi 32024-Q2TSMC 5nm128GB HBM2E1.835 PFLOPS900W现役旗舰
Gaudi 42026-Q2(推测)Intel 18A192GB HBM3E3.7 PFLOPS(推测)700W待发布

Gaudi 3 的差异化武器是集成 24× 200GbE RoCE 以太网互联——双向 600 GB/s 带宽,兼容任意以太网交换机,无需 NVLink 等私有互联,最多可扩展至 8,192 节点。这让 Gaudi 成为多云、多厂商环境下软件独立性最强的方案。官方数据显示其 LLM 训练较 H100 快 50%,PyTorch 迁移只需 3 行代码改动,客户覆盖 IBM 云、Supermicro、ASUS、Lambda Labs。

但承压也是真实的。Gaudi 4 是 Gaudi 系列的关键一搏:转向 Intel 18A 自有工艺(从 TSMC 5nm 的战略转变),192GB HBM3E、FP8 算力翻倍至 3.7 PFLOPS。站内卡提示了一个残酷的可能性——随着 Intel 于 2026 年 5 月 14 日取消 Falcon Shores、转向机柜级 Jaguar Shores,Gaudi 4 可能是独立 Gaudi 加速器的最后一颗芯片。

Jaguar Shores:从单芯片竞赛转向机柜级系统​

Jaguar Shores 代表了 Intel AI 路线图的根本转向。Falcon Shores 的失败教训很明确:单芯片 200 PFLOPS 的目标在 Rubin R200(约 50 PFLOPS 已是行业极限)面前既不现实也不经济,叠加连续季度亏损与 HBM 供应紧张,Intel 在 2026 年 5 月正式砍掉该项目。

指标Falcon Shores(已取消)Jaguar Shores(路线图)
形态单芯片 GPU机柜级系统
对标B100/B200 单芯片NVL72 / AMD Helios 机柜
加速器 IPGaudi + GPU 融合Gaudi v4 架构演进
集成 CPU无Xeon 6/7 紧耦合
网络无集成 NIC800G 集成 NIC
制程Intel 18AIntel 18A / 14A
发布2025(取消)2027-2028

Jaguar Shores 的每机柜配置(推测口径):64-128 颗 AI 加速器、32-64 颗 Xeon、机柜级 160-320 PFLOPS FP8、80-120 kW TDP。其本质是承认一个现实——2026 年之后的市场由 NVIDIA NVL72、AMD Helios、谷歌 TPU Pod 这类机柜级/超节点方案主导,单芯片对标已经失去意义。

Crescent Island:补位智能体推理​

在 Jaguar Shores 遥远的 2027-2028 到来之前,Intel 需要一张当下就能打的牌,这就是 Crescent Island。站内卡显示,这款推理 GPU 于 2026 年 6 月 Computex 首次披露、8 月 Hot Chips 公布完整架构:

项目Crescent Island
架构Xe3P(XMX 升级至 16 深度脉动阵列)
内存160GB LPDDR5X(参考卡)/ 最高 480GB(ODM 版本)
精度原生 FP8 / FP4
TDP350W
形态PCIe Gen5 x16,风冷
目标智能体 AI(Agentic AI)推理
出货2026 下半年限量

480GB LPDDR5x 是它的灵魂——约为 NVIDIA L40S(48GB GDDR6)的 10 倍容量,而 LPDDR5x 的成本远低于 HBM。350W 风冷 PCIe 意味着可以塞进任何现有服务器。它甚至移除了 3D 图形与光追硬件,成为纯 AI 推理芯片。对于词元密集、成本敏感的智能体推理负载,这是一条务实的差异化路线。

三次生态错位:Intel AI 的病根​

回顾 Intel 在 AI 加速器上的挣扎,三次错位值得复盘:

  1. 收购整合错位:2019 年以约 20 亿美元收购 Habana Labs 替代 Nervana,但 Gaudi 1/2 两代产品始终未能形成规模出货,错过 2020-2022 年训练市场的窗口期。
  2. 软件栈错位:SynapseAI 生态仅积累数年,PyTorch 模型虽约 80-90% 可零修改运行,但复杂 LLM 训练仍需手工优化——在 CUDA 十八年生态面前,"能跑"与"好用"之间隔着巨大的工程鸿沟。
  3. 路线图错位:从 Gaudi 独立产品线,到 Falcon Shores 融合芯片,再到 Jaguar Shores 机柜级系统,五年三次转向,每一次转向都让潜在客户陷入观望。

值得肯定的是,Intel 并非全面溃败。MLPerf v6.1 中 Intel 以纯软件优化收获了可观的性能增益,证明 Gaudi 软件栈在快速成熟;Applied Materials 与 Intel 扩大下一代互连扩展与 Foveros 3D 封装合作,AI 芯片对先进封装的需求加速反而放大了 Intel 少数的结构性优势——Foveros 3D 与互连技术正是 Intel 在先进制程追赶之外,最有底气的能力项。

CPU 涨价与份额流失并存的怪象​

10 月 5 日起 Intel CPU 涨价 10%,这已是年内第三次提价。与此同时,分析师圈流传着客户计划"dump Intel"的说法——服务器 CPU 份额持续流向 AMD EPYC 与 ARM 阵营。涨价与丢份额并存看似悖论,实则反映了 Intel 的定价策略转变:与其用低价守卫正在流失的份额,不如在存量客户身上实现利润最大化,将资源投向代工与 AI 业务。PC 侧,微软推动的驱动质量倡议 DQI(Driver Quality Initiative)中,Intel GPU 驱动率先适配 Windows 11 26H2,显示 Intel 在客户端生态上仍在积极投入。

"CPU 求稳 + AI 求突破"的双线评价​

Intel 当前策略可以概括为双线作战:x86 CPU 业务追求利润与稳定性(涨价、Clearwater Forest/Diamond Rapids 按部就班),AI 业务则寻求结构性突破(18A 代工、Foveros 3D、Jaguar Shores 系统级翻身仗)。这条路线的风险在于时间——Jaguar Shores 2027-2028 年才落地,期间 AI 市场的每一轮洗牌都在稀释 Intel 的存在感;机会在于,一旦 18A/14A 制程如期兑现,Intel 将同时握有"AI 代工厂 + 机柜级系统"两张牌,这是 NVIDIA 与 AMD 都不具备的组合。

小结​

Intel 的 AI 芯片故事是一部持续纠错史:Gaudi 3 以开放以太网互联守住性价比阵地,Gaudi 4 背负着独立产品线的存亡押注,Crescent Island 用 LPDDR5x 在智能体推理市场找到现实的立足点,Jaguar Shores 则代表彻底放弃单芯片竞赛、转向机柜级系统的战略重构。对采购决策者而言,2026 年的 Gaudi 3/4 + Crescent Island 组合在多云、成本敏感场景仍有独特价值;而对行业观察者,2027 年 Jaguar Shores 的兑现程度,将决定 Intel 是 AI 算力牌桌上的常驻玩家,还是仅仅扮演"AI 代工厂"的幕后角色。

从 Rubin Ultra 到 Feynman:NVIDIA 2027-2028 路线图全解读

· 阅读需 7 分钟
Industry Research Team

当 Rubin R200 还在陆续爬坡之际,NVIDIA 的下一个两年已经被写进路线图:2027 H2 的 Rubin Ultra 与 2028 年的 Feynman。但与以往"官宣即定型"不同,Rubin Ultra 在 2026 年经历了一次罕见的架构大改——原版 4 芯片设计被取消。本文依据站内芯片数据库与行业路线图口径,拆解这次调整背后的工程与商业逻辑。

Rubin Ultra(V300):从官宣到修订​

Rubin Ultra 在 GTC 2026(2026-03-17)与 Rubin R200 一同公布,定位超大规模训练/推理的顶端产品。据站内芯片数据库,其原版设计规格如下:

规格参数(原版设计,待官方最终确认)
GPU 架构Rubin 架构(MCM 多芯片模块)
封装原版 4 芯片设计(已取消)
FP4 推理算力推测约 100 PFLOPS(原版,密集)
FP8 训练算力推测约 70 PFLOPS(原版)
显存容量576 GB HBM4e(原版设计)
显存带宽推测 >44 TB/s(HBM4e)
互联技术NVLink 7(推测,单向 >3.6 TB/s)
TDP推测 3000W+(必须液冷)
量产时间推测 2027 H2 – 2028
定价推测单 NVL144 机柜 1500-2100 万美元

原版 NVL144 机柜配置为 144 颗 Rubin Ultra GPU + 72 颗 Vera CPU,总显存 82.9 TB HBM4e,FP4 总算力推测约 14 EFLOPS,TDP 推测约 360kW——是 Vera Rubin NVL72(约 180kW)的整整一倍。

关键调整:4 芯片设计取消​

2026 年最重要的路线图变化,是据 SemiAnalysis 报道,原版 4 芯片 Rubin Ultra 设计因封装制造难度被取消,新版规模缩减约一半、性能相应减半,仅保留 2 芯片版本——规模扩展能力弱于原设计。站内芯片数据库也明确记录了这一调整。

与之相伴的是显存减配传闻:2026 年 9 月,SemiAnalysis 与科创板日报报道 Rubin Ultra 的 HBM 配置拟从 HBM4E 12-Hi(384GB 档)下调至 HBM4 8-Hi(192GB),三星配合开发 8 层产品。动因是 HBM/DRAM 涨价后内存已占整机 TCO 约 40%,减配后 HBM 成本可降超 50%;省下的预算转向 Scale-up 纵向扩展网络——以 NVL576 NPO 方案测算,Scale-up 网络占机架支出比例将从 4% 升至 12%。TrendForce 显示 NVIDIA 自 2026 Q3 起并行评估 HBM4E 8-Hi、HBM4E 12-Hi、HBM4 8-Hi 多套方案。

行业路线图口径:VR300 NVL576 与 Feynman​

行业路线图汇总口径(Thunder Compute,2026-10)给出了另一个观察视角,需注意与 GTC 2026 原版公布信息存在差异,最终以官方为准:

产品目标时间关键规格(行业口径)
Rubin Ultra VR3002027 H2100 PFLOPS FP4/GPU、1TB HBM4e、NVL576、机架约 600kW
Feynman2028规格未公布(preliminary/未确认)

这个口径下的 VR300 与站内数据库记录的原版 NVL144(576GB HBM4e/GPU)明显不同:单卡显存更高(1TB)、机柜规模更大(NVL576)、单机架功耗推高到约 600kW。两条信息线的分歧恰恰说明 Rubin Ultra 仍处于架构修订期,唯一确定的是方向——显存继续翻倍、机柜规模继续翻倍、功耗继续飙升。

一年一代:与客户 capex 的绑定节奏​

从 Hopper(2022)到 Blackwell(2024)再到 Rubin(2026),NVIDIA 已把旗舰产品节奏锁定为两年一代;而在同一代际内部,GB200→GB300 的中期升级又把"可买的最新品"刷新周期压缩到约一年。这种节奏对客户 capex 形成了强绑定:

  • 锁定采购:超大规模云厂商若想保持算力性价比领先,必须按 NVIDIA 的节奏滚动下单,否则两年后单位算力成本被拉开数倍;
  • 规划反推:Rubin Ultra 的 2027 H2 时间点,意味着客户 2026 年就要锁定机位、电力与液冷改造——约 600kW/机架的功耗口径直接改写数据中心设计规范;
  • 竞争挤压:AMD Helios II/MI500 同样瞄准 2027 年窗口,NVIDIA 把 Rubin Ultra 顶在 2027 H2,本质上是在客户年度预算分配前抢先占位。

HBM4e 供给与功耗:砍半的真实原因​

Rubin Ultra"砍半"并非技术退缩,而是三重现实约束的交汇:

  1. 封装良率:4 颗计算 die 的 MCM 封装对 CoWoS-L 工艺的良率要求过高,量产风险不可控;
  2. HBM 成本:内存占 TCO 40% 的现实下,576GB→192GB 档的减配能省下过半 HBM 预算;
  3. 功耗墙:原版 360kW 乃至行业口径 600kW 的机架功耗,正在逼近现有液冷基础设施与供电改造的承受极限。

省下的预算被重新分配给 Scale-up 网络——这透露出 NVIDIA 的判断:下一代旗舰的瓶颈不在单卡 FLOPS,而在机柜内纵向扩展的互联效率。光互联(NPO)进入 Scale-up 网络,就是这个判断的落地。

Feynman:2028 的悬念与命名暗示​

Feynman 目标 2028 年,目前规格完全未公布(preliminary/未确认)。但命名本身已传递信息——继以物理学家命名的传统(Fermi、Maxwell、Volta),Feynman(理查德·费曼)指向的是量子电动力学与路径积分的缔造者。行业普遍猜测其架构方向可能包括:更激进的近存计算、光子互联的规模化引入,以及面向 agentic AI 负载的原生优化。考虑到 NVIDIA 2026 年收购 Groq 后已在 LPU 架构上积累经验,Feynman 完全可能首次把"训练芯片"与"推理加速器"在架构层面统一调度。

不过需要冷静看待:NVIDIA 的公开路线图历来在临近发布时大幅修订,Feynman 的最终形态大概率与今天的任何猜测都不同。

与 AMD Helios II/MI500 的时间赛跑​

2027 年的正面交锋已经排定:AMD 的 Helios II 机架与 MI500 系列瞄准同一时间窗口。AMD 的打法是开放生态(UALink、开放 HBM4/4e 规格)+ 激进显存(延续 MI400 432GB HBM4 的堆料路线),而 NVIDIA 则以 NVLink 域规模与 CUDA 软件栈守正。Rubin Ultra 的架构修订,某种意义上正是对 AMD 显存策略的回应——当单卡显存竞争的成本效益递减时,把预算转向 Scale-up 网络与系统效率是更聪明的花法。

小结​

NVIDIA 2027-2028 路线图的核心叙事是"从堆规格到堆系统":Rubin Ultra 取消 4 芯片设计、显存减配、预算转向 Scale-up 光互联,是 HBM4e 供给与功耗现实下的理性选择;行业口径中 2027 H2 的 VR300 NVL576 与 2028 年的 Feynman,则勾勒出机架功耗迈向 600kW、架构走向异构统一的下一幕。对采购方而言,最重要的不是记住这些规格数字,而是理解一年一代节奏下"早买早享受、晚买享折扣"的 capex 决策模型正在失效——不跟上节奏,两年后的单位算力成本差距将大到无法用预算延迟来弥补。

2026年Q4 AI芯片前瞻:Rubin放量、Helios交付、昇腾950DT上市与国产新窗口

· 阅读需 4 分钟
Industry Research Team

2026年进入第四季度,AI芯片竞争的关键词从"发布"转向"交付"。Rubin能否持续放量、Helios能否如期爬坡、昇腾950DT如何定价上市,将共同决定2027年竞争格局的起点。

NVIDIA:Rubin放量与生态开放双线推进​

Q4期间NVIDIA的计划主线:

  • Vera Rubin NVL72:2026下半年持续放量,MLPerf Inference v6.1首秀已登顶(Qwen3-VL较GB300最高3.7倍),HBM4平台优势开始兑现;
  • N1X:基于RTX Spark的PC处理器按计划2026年秋季上市,打开消费级战场;
  • Blackwell Ultra(B300):租用价格参考Nebius口径约9.50美元/GPU小时,仍是当前租赁市场的重要基准;
  • 后续代际:Rubin Ultra等后续路线待发;
  • 生态动作:NVLink Fusion持续开放生态,NVHBM定制内存方案推进。
产品/计划Q4状态
Vera Rubin NVL722026下半年持续放量
N1X秋季上市
B300租用9.50美元/GPU小时(Nebius口径)
Rubin Ultra待发布
NVLink Fusion / NVHBM生态开放与定制内存推进

AMD:Helios从首发出货到Q4爬坡​

AMD在Q4的核心任务是交付:

  • Helios机架:MI455X首批出货目标Q3末,Q4进入量产爬坡阶段;
  • 客户部署:OpenAI 6GW、Meta 6GW部署合作推进中,微软作为首批客户计划2026年下半年交付;
  • MI430X:驱动欧洲LUMI-AI超算,拓展科学计算场景;
  • ROCm:软件生态继续补齐;
  • 下一代:Helios II / MI500级产品路线待公布。

华为:昇腾950DT上市与云服务全球商用​

华为Q4的关键节点最为明确:

  • 昇腾950DT:Q4上市,报价超25万元;
  • 昇腾950智算集群云服务:9月30日已国内商用,11月30日全球商用;
  • 960系列:计划2027年接棒,970/980排在2028-2029年。

阿里平头哥:真武V900量产倒计时​

平头哥的时间表指向2027年:真武V900计划2027年Q1量产上云,配套磐久AL128与50万卡集群规划;J900排期2027年Q3。Q4将进入量产前最后的验证阶段。

OpenAI/博通 Jalapeño:多吉瓦部署推进​

OpenAI与博通合作的Jalapeño定制芯片规格已明确:13.4 PFLOPS(4-bit精度)、232GB内存,多吉瓦部署规划正在推进。这枚自研芯片的量产进度,将直接影响OpenAI未来的算力自给率。

关键变量:三大约束​

Q4的交付兑现程度,将取决于三个外部约束:

  1. HBM供给:戴尔CEO警告2027年可能比2026年更紧缺,HBM产能是所有GPU路线图的共同瓶颈;
  2. 国产涨价传导:昇腾950DT涨价20%-50%、寒武纪690涨价20%-30%(路透,HBM成本驱动),涨价将传导至国产算力服务价格;
  3. 电力约束:Emerald AI/Google/NVIDIA成立的AEMA电网响应模式,预示电力正在成为算力扩张的第一性约束。

三条观察建议​

基于上述事实,给三类角色的观察点(非投资建议):

  • 采购方:昇腾950DT与寒武纪690的涨价幅度表明国产算力已进入卖方市场,锁量谈判宜早不宜迟;同时关注Helios Q4实际爬坡数据,作为第二供应源评估依据;
  • 开发者:ROCm生态补齐与NVLink Fusion开放,意味着2027年异构算力混布的软件门槛正在降低,可提前在推理侧做多框架适配;
  • 投资者:可跟踪的公开观察点包括——Helios首批交付兑现情况、昇腾950云服务11月30日全球商用落地、HBM价格走势对各家毛利率的影响信号。

小结​

2026年Q4是"交付验证季":NVIDIA Rubin放量、AMD Helios爬坡、昇腾950DT上市与云服务全球商用、平头哥V900量产倒计时——各家计划均已排定,剩下的变量集中在HBM供给、涨价传导与电力约束三点。所有时间节点以"计划/预计/排期"口径为准,Q4末回看兑现率,就是对2027年格局的最好预判。

摩尔线程"庐山"GPU年底亮相:3A游戏渲染提升15倍、光追性能提升50倍

· 阅读需 5 分钟
Industry Research Team

从"国产兼容显卡"到"硬件光追+AI生成式渲染",摩尔线程正在完成一次技术范式层面的跃迁——而AI算力与游戏GPU的双线并进,让这次跃迁有了更厚实的商业底座。

"庐山"来了:15倍渲染、50倍光追、64倍AI​

2026年9月3日,摩尔线程在半年度业绩说明会上介绍了下一代高性能图形渲染芯片规划:基于**"花港"架构的新一代GPU——"庐山"**,预计实现三大性能跃升:

  • 3A游戏渲染性能提升15倍
  • 光线追踪性能提升50倍
  • AI性能提升64倍

官方计划于2026年底推出"庐山"芯片(上市时间以官方发布为准)。这三个数字放在一起,勾勒出的不是一次常规的代际迭代,而是一次"重写底座"式的升级:光追50倍意味着硬件光追从"支持"走向"实用",AI性能64倍则预示着AI能力将从图形附庸升级为核心卖点。

两大核心渲染技术​

"庐山"的性能跃升背后,是两项核心渲染技术支撑:

其一是实时光线追踪。"庐山"基于花港架构设计了硬件光线追踪加速引擎,并支持DirectX Raytracing(DXR)。此前国产GPU普遍通过软件手段或有限硬件支持来兼容光追,而专用加速引擎+DXR支持的组合,意味着"庐山"将具备与主流游戏引擎光追管线对接的能力——这是3A游戏生态的门票。

其二是AI生成式渲染AGR。摩尔线程推出全自研的MTAGR 1.0技术,推动渲染范式"从计算走向生成"。传统光栅化渲染是逐像素计算的暴力美学,而生成式渲染借助AI模型直接生成画面细节,用更少的算力换更高的画质与帧率。NVIDIA的DLSS、AMD的FSR已验证了AI超分路径的价值,MTAGR 1.0则是国产GPU在渲染范式变革上的主动跟进——且选择直接押注"生成"而非仅仅"超分"。

双线并进:游戏GPU与AI算力​

"庐山"的故事不止于游戏。摩尔线程2026年的商业化进展呈现出游戏与AI算力两条腿走路的格局:

时间事件意义
此前登陆科创板上市打开资本通道,支撑高研发投入
9月3日半年度业绩说明会公布"庐山"规划图形GPU技术路线图明确
9月19日(报道)京东云与摩尔线程合作万卡级集群部署上线国产GPU万卡集群规模化落地
9月23-27日数贸会(杭州)展示AI智算卡、万卡级集群展示"模型训练工厂/词元生产工厂/智能体生产工厂"

在杭州数贸会上,摩尔线程展示的产品覆盖云-边-端全场景:AI智算卡、万卡级集群,以及面向大模型生命周期的"模型训练工厂""词元生产工厂""智能体生产工厂"。这套叙事与京东云万卡集群的落地相互印证——摩尔线程的AI算力业务已经从"卖卡"进入"卖集群、卖工厂"的深水区。

技术跃迁的深层逻辑​

回顾国产GPU的发展路径,第一代产品的核心命题是"兼容"——让Linux桌面、办公软件、视频播放跑起来;而"庐山"的命题变成了"范式"——硬件光追对接主流3A管线、AGR参与全球渲染范式变革、AI性能面向大模型时代。从跟随式兼容到范式级参与,这是国产GPU厂商第一次在图形技术方向上与国际一线站在同一条起跑线附近。

AI性能提升64倍的目标也值得放在行业背景下解读:图形与AI本就同源,硬件光追引擎与AI算力单元共享大量基础能力。"庐山"把AI性能提升作为核心指标,说明花港架构在设计之初就为图形+AI双重负载做了统一规划。

小结​

"庐山"GPU承载着摩尔线程的三重跨越:技术上,从软件兼容走向硬件光追与MTAGR 1.0生成式渲染的范式创新;产品上,从单一显卡走向云-边-端全栈布局;商业上,从科创板上市到京东云万卡集群落地,AI算力与游戏GPU双线并进。3A渲染15倍、光追50倍、AI性能64倍的目标能否兑现,要等2026年底产品揭晓(以官方发布为准),但方向已经清晰:国产GPU不再满足于"能用",而是开始追求"领先"。

2nm时代开启:AMD MI455X成首款TSMC N2 AI GPU,三星/台积电2027量产竞速

· 阅读需 5 分钟
Industry Research Team

2nm不再只是制程路线图上的一个名词,它已经成为AI算力竞赛的物理基础。AMD MI455X的问世,宣告最先进制程正式进入AI加速器的主战场。

MI455X:首款N2制程AI GPU登场​

2026年7月23日,AMD在Advancing AI活动中正式发布基于CDNA 5架构的MI455X。而在Hot Chips 2026上,AMD首次公开了这款芯片的chiplet级细节,其中最重磅的信息是:8个加速复杂裸片(XCD)采用台积电N2(2nm)制程制造,这使MI455X成为业界首款采用N2的AI GPU。

N2是台积电首个量产的2nm节点,也是其首次在逻辑制程中采用GAA环绕栅极晶体管的第二代演进。把旗舰AI加速器的主力计算裸片押注在新节点上,AMD对2nm良率与产能的信心可见一斑。

Chiplet架构深度解析​

MI455X的架构设计体现了"异构集成极致化"的思路:

部件制程/规格关键参数
8个XCD计算裸片台积电N2(2nm)3D混合键合(Hybrid Bonding)堆叠
Fabric/Cache/IO裸片台积电N3P承担互连、缓存与外围功能
封装CoWoS-L台积电先进封装
晶体管总数—3200亿
HBM412个堆栈432GB、23.3TB/s带宽
全局L2缓存—192MB

几个值得注意的设计选择:

  • 3D混合键合:8个XCD不再仅靠2.5D互连并排摆放,而是通过3D混合键合垂直堆叠集成,大幅缩短裸片间信号路径、提升互连密度。
  • 制程分工:计算裸片用最先进的N2追求性能与能效,而fabric/cache/IO裸片采用更成熟、成本更低的N3P——这是chiplet时代"好钢用在刀刃上"的典型做法。

内存与算力:对MI355X的代际跃升​

对比上一代MI355X,MI455X在内存和算力两个维度都实现了跨越:

指标MI355X(HBM3E)MI455X(HBM4)提升幅度
显存容量288GB432GB1.5倍
总带宽—23.3TB/s约2.9倍
MXFP4算力—40.26 PFLOPS4倍
MXFP6/MXFP8算力—各20.13 PFLOPS—

低精度数据格式的全面支持是CDNA 5的重点:MXFP4算力达到MI355X的4倍,直接面向当前主流的大模型FP4推理与训练场景。

架构演进:Wave32、超越函数引擎与数据搬运器​

除了制程和规格,MI455X在微架构层面有三处关键改动:

  1. 原生Wave32执行:从传统Wave64转向原生Wave32,降低指令延迟与寄存器压力,让SIMD单元利用率更高,尤其利于注意力机制等不规则计算负载。
  2. 超越函数引擎:新增专用引擎加速attention中的数学运算(如指数、归一化等超越函数),直击Transformer推理的热点。
  3. Tensor Data Mover:专门的数据搬运单元,减少计算单元在数据调度上的空转,提高实际有效算力占比。

这三项改动共同指向一个目标:让纸面PFLOPS尽可能转化为真实吞吐。

2nm量产竞速:台积电、三星与Intel的三角格局​

MI455X只是2nm竞赛的开局。2026年9月的报道显示,三星正联合台积电推进2nm AI芯片制程,目标2027年量产,能效比提升40%。两大代工厂不约而同地把2nm的市场切入点选在AI芯片上——因为只有AI客户能承受先进制程的晶圆成本,也只有AI负载能把每瓦性能的价值放大到极致。

另一边,Intel Foundry的High NA EUV已累计处理超过100万片晶圆(截至2026年9月21日当周的报道),在1.4nm及以下节点上,Intel试图用High NA EUV实现技术反超。代工三强的2nm/1.4nm竞速,本质上是在为2027年之后的AI芯片订单排兵布阵。

能效比:下一个主战场​

为什么整个行业都在押注2nm?答案不是峰值算力,而是能效比。当单个训练集群的功耗达到数百兆瓦时,制程每提升一代带来的每瓦性能改善,会直接折算成电力基建成本和运营费用的下降——这正是前文所述"算力竞赛变成电力竞赛"的技术呼应。三星与台积电宣传的"能效比提升40%",对应的正是客户最痛的那根神经。

小结​

MI455X用8个N2制程XCD、3D混合键合、3200亿晶体管和432GB HBM4,把AI GPU的工程上限推到了新高度;而Wave32原生执行、超越函数引擎和Tensor Data Mover则展示了微架构层面让算力"落地"的努力。随着三星/台积电剑指2027年2nm量产、Intel以High NA EUV蓄力,先进制程与AI算力已经深度捆绑。2nm时代的开启意味着:未来AI芯片的竞争,将在原子尺度上决出胜负。

平头哥公布倚天CPU路线图:倚天720/730明年推出,730首次全自研微架构

· 阅读需 5 分钟
Industry Research Team

在Agentic AI重塑算力需求结构的当下,平头哥首次公开倚天服务器CPU发展蓝图——全自研微架构与ICN总线直连,是这份路线图最值得关注的两个关键词。

云栖大会:倚天蓝图首次公开​

2026年9月22日的云栖大会上,平头哥首次公开倚天系列服务器CPU的发展蓝图:2027年将推出倚天720与倚天730两款服务器CPU。这是平头哥第一次以路线图的形式,系统性地向外界展示倚天CPU的演进节奏——从"发布单点产品"到"公布多代路线",意味着倚天系列的研发与规划已经形成了清晰的代际滚动机制。

型号推出时间核心亮点
倚天710已商用现役主力,后续产品的性能基准
倚天7202027年单核性能、核密度与能效全面提升
倚天7302027年首次基于平头哥全自研CPU微架构设计,单核SPECint2017/GHz性能最高提升至倚天710的1.4倍
倚天750时间未公开基于第二代自研核,支持平头哥自研ICN片间互联总线协议

倚天720与倚天730:差异化分工​

两款2027年的新品各有侧重。倚天720走的是"全面均衡"路线:单核性能、核密度与能效三项指标同步提升,面向通用算力场景的规模化部署——在数据中心机柜功率与空间约束日益收紧的背景下,核密度与能效的提升直接决定了单位机柜可承载的算力上限。

倚天730则是更具突破意义的一代:它首次基于平头哥全自研CPU微架构设计,单核SPECint2017/GHz性能最高提升至倚天710的1.4倍。SPECint2017/GHz衡量的是单位频率下的整数性能(即IPC水平),1.4倍意味着微架构层面的显著优化,而非单纯依靠频率或制程红利。从"基于授权架构"到"全自研微架构",这是服务器CPU自研道路上最关键的一次跨越——它决定了后续每一代产品能否摆脱外部授权的节奏约束。

ICN总线:CPU与AI芯片的直连时代​

路线图中另一个关键角色是ICN片间互联总线协议。根据蓝图,基于第二代自研核的倚天750将支持平头哥自研的ICN总线协议,倚天CPU与真武AI芯片之间可通过ICN总线直接互联,进一步提升CPU与AI芯片的协同效率。

这一设计直指传统架构的痛点:在现有体系中,CPU与AI加速卡之间通常通过PCIe等通用互联通信,带宽与延迟都存在损耗,而这些损耗恰恰发生在数据预处理、梯度同步、通信协同等高频环节。ICN总线让CPU与AI芯片"原生对话",相当于把CPU纳入AI集群的整体互联拓扑,而非让它们停留在AI芯片的"外围"。

Agentic AI时代的CPU需求分化​

平头哥此时公布CPU路线图,并非偶然。其背景是Agentic AI正在驱动CPU需求分化:智能体应用大规模兴起后,CPU不再是AI服务器里"配平"的角色——Agent的调度、编排、数据处理与轻量推理,对CPU的核密度、能效与协同能力都提出了新要求。通用CPU与AI算力的配比、互联方式,都在被重新设计。

同期发布的真武V900构成了这套蓝图的全栈拼图:216GB显存、1200GB/s片间互联、支持50万卡集群。叠加倚天CPU经ICN总线直连的能力,阿里云正在构建"AI芯片+CPU+网络"的全栈算力体系——芯片自研、互联自研、CPU自研,三层能力的耦合度越高,系统的整体效率上限就越高。

小结​

倚天720/730定档2027年、倚天730首次采用全自研微架构、单核SPECint2017/GHz性能最高提升至倚天710的1.4倍,再加上ICN总线与真武AI芯片直连的规划、真武V900(216GB显存、1200GB/s片间互联、50万卡集群)的全栈拼图,平头哥给出了一条清晰且野心不小的CPU自研路线。在Agentic AI驱动的算力变革中,"AI芯片+CPU+网络"的全栈协同能力,或将成为云厂商竞争的下一个分水岭。

昇腾 960 官宣发布:FP4 算力翻倍、全球首个 NPO 超节点,华为确认一年一代

· 阅读需 6 分钟
Industry Research Team

2026 年 9 月 17 日,华为全联接大会(HC2026),华为常务董事、ICT 基础设施业务总裁汪涛正式发布昇腾 960。与 8 月数字中国峰会上的"路线图预告"不同,这次是完整的规格官宣——而且提前三个季度就绪。本文基于华为官网新闻稿及多方报道整理,逐项拆解 960 的规格、超节点与路线图含义。


1. 昇腾 960:双版本,训练先行​

昇腾 960 分为两个版本,节奏错开一个季度:

指标昇腾 960DT(训练版)昇腾 960PR(推理版)
FP8 算力2 PFLOPS(较 950 翻倍)待披露
FP4 算力4 PFLOPS待披露
显存288GB(自研 HBM)待披露
显存带宽9.6 TB/s待披露
配套超节点Atlas 860(风冷)Atlas 960(液冷)
就绪 / 上市2027 Q1 / 2027 Q22027 Q3

三个读数:

  • 提前三个季度就绪:960DT 原计划 2027 年 Q4,现在 2027 Q1 就绪、Q2 上市——与 950DT"提前上线华为云"一脉相承,路线图可信度在持续兑现;
  • 精度口径与英伟达对齐:FP8 / FP4 主口径(辅以自研 HiF8 / HiFP8),FP4 已是 2026 新卡的通用口径;
  • 288GB 自研 HBM + 9.6TB/s:显存容量与带宽同步翻倍,对训练长上下文大模型是实打实的容量红利。

单卡规格详见昇腾 960 规格页;上一代昇腾 950DT 规格页。

2. 昇腾 960 超节点:全球首个 NPO 超节点​

这是本场发布真正的"重器"——昇腾 960 超节点是全球第一个采用 NPO(近封装光学)的超节点:

指标昇腾 960 超节点
单节点规模4096 卡
系统算力8 EFLOPS FP8 / 16 EFLOPS FP4
HBM 总容量1 PB
互联 RTT低至 2μs
可用度99.8%

NPO 意味着什么:传统光模块挂在交换机面板上,信号要先出封装再转电—光;NPO 把光引擎挪到交换芯片封装近旁,大幅缩短 SerDes 距离、降低功耗与时延。华为的具体数字:

  • 5500 个自研 Hi-ONE 光引擎(业界首个量产 NPO,单引擎 7.2T);
  • 替代 4.8 万颗 800G 光模块;
  • 降低功耗 550kW 以上,同时支撑 2μs 级互联时延。

对比 8 月数字中国峰会的口径(Atlas 960 单超节点 15488 卡),官方最新口径为单超节点 4096 卡(1 个超集群可由多超节点组成)——以华为官网最新新闻稿为准。

⚠️ 华为还给出了"MFU 提升 2.75 倍""推理时延降低 70%"等收益数据,均出自华为马尔科夫实验室仿真,尚无独立第三方实测,阅读时注意口径。

3. 一年一代:970(2028)→ 980(2029)​

华为首次把"一年一代"从愿景变成官宣承诺:

年份产品状态
2026昇腾 950 系列950PR 已量产,950DT Q4 放量
2027昇腾 960本次官宣,提前就绪
2028昇腾 970HC2026 确认
2029昇腾 980HC2026 确认

支撑这一节奏的是华为提出的"韬定律":算力规格每代翻倍,访存带宽、访存容量、互联带宽同步大幅提升。

生态侧的同场数据也值得记录:CANN 外部开发者占比首次超过 61%、月活开发者 5200 人;910C 超节点部署已超 1000 套。

4. 竞争坐标:单卡有代差,系统级对打​

把 960DT 放到 2027 年的棋盘上看:

  • 对 NVIDIA Rubin(R200:288GB HBM4 / 50 PFLOPS FP4):单卡 FP4 算力约为 R200 的 8%(4 vs 50 PFLOPS),单卡代差客观存在;但 4096 卡超节点 + NPO 互联是系统级竞争——用"可交付的超大集群"对打单卡性能;
  • 对采购方:960 的价值主张是"在国产量产约束内拿到最大可用集群"。DeepSeek 拟采购 16 万颗 950DT 跑推理的订单已经证明:当供给与生态到位,头部实验室愿意主动选国产;
  • 对国产链条:950→960 的显存翻倍直接拉动国产 HBM 迭代,这是整条链的胜负手。

5. 小结​

  • 960DT:FP8 2P / FP4 4P、288GB HBM、9.6TB/s,2027 Q2 上市,提前三个季度;
  • 960 超节点:全球首个 NPO 超节点,4096 卡 / 8 EFLOPS FP8 / 1PB HBM / RTT 2μs;
  • 路线图:一年一代官宣至 2029,950、960 均提前兑现,规划可信度显著上升;
  • 看什么:2027 Q2 实际交付节奏、国产 HBM 产能、CANN 生态的第三方模型覆盖度。

相关阅读​

参考资料​

  • 华为官网:发布全球首个采用 NPO 的超节点(昇腾 960 超节点)(2026-09-17)
  • 电子工程专辑:国产 AI 芯片新突破!华为昇腾 960 芯片将提前发布
  • 环球网:华为全联接大会 2026 主题演讲报道

本文基于华为官网新闻稿与公开报道整理。MFU、时延等收益数据为华为实验室仿真口径;2028 / 2029 产品仅为路线图官宣,规格以未来发布为准。

AWS 再加购 200 万颗英伟达 GPU:Vera CPU 首次登陆 AWS,10 万颗专供美国政府 AI 工厂

· 阅读需 5 分钟
Industry Research Team

本文基于 AWS 与 NVIDIA 官方公告(2026 年 9 月 5 日)及双方高管公开表态整理。

2026 年 9 月 5 日,AWS 与英伟达宣布扩大战略合作:在 GTC 2026 已宣布的「2026 年起新增 100 万颗 GPU」计划之上,再追加部署 200 万颗 NVIDIA GPU,覆盖 Blackwell Ultra、Rubin 与 Rubin Ultra 三代架构,时间窗口为 2027-2028 年。需求增长超出此前所有预测,是双方给出的直接理由。

这不再是单纯的「买卡」,而是一次覆盖 GPU、CPU、互联、内存、开源模型与软件的全栈合作。我们把关键信息拆成六点。

一、200 万颗 GPU 的构成与节奏​

  • 规模:200 万颗(在原有 100 万颗计划之上追加,总承诺规模翻了三倍)
  • 架构:Blackwell Ultra、Rubin、Rubin Ultra
  • 时间:2027-2028 年,部署于 AWS 全球基础设施(含新建 AI 工厂)
  • 背景:亚马逊 2026 年资本支出指引已从 2000 亿美元上调至 2200 亿美元,CEO 安迪·贾西明确表示仍不足以满足 AI 算力需求

作为参照,GTC 2026 上黄仁勋给出的口径是:Blackwell 与 Rubin 两大平台至 2027 年的累计订单与需求规模已上看 1 万亿美元(GTC 2025 时对 2026 年的判断约为 5000 亿美元)。AWS 的加购是这个大盘子里最重的一块拼图之一。

二、Vera CPU 首次登陆 AWS​

这是本次合作里最具结构性的变化:NVIDIA Vera CPU 基础设施将进入 AWS。

Vera CPU 是 Vera Rubin 平台中面向 agentic AI 设计的通用处理器,定位是把 AI 资源高效转化为「完成的智能体任务」。随着智能体工作负载兴起,CPU 侧的任务编排、内存管理、数据调度压力同步上升——纯 GPU 扩容已经不够,AWS 需要与之配套的高性能 CPU 层。这也与 AWS「从自研芯片(Graviton/Trainium)到合作伙伴芯片提供最广算力选择」的策略一致:Vera 不替代 Trainium,而是补齐加速基础设施旁边的 CPU 算力层。

在 re:Invent 2025 上,AWS 宣布下一代 Trainium 芯片支持 NVIDIA NVLink Fusion 高速互联。本次双方把合作再推进一步:

  • 亚马逊 Annapurna Labs 将支持英伟达新的定制高带宽内存 NVHBM(与内存供应商合作开发)
  • Trainium 由此可以获得更快、更省电的内存选项
  • Trainium 与 GPU 可以在同一机架级架构内协同,共享 scale-up 互联

对芯片行业来说,这是一个值得盯紧的信号:NVLink Fusion + NVHBM 意味着英伟达的互联与内存技术开始向竞品 ASIC「供货」。自研 ASIC 阵营(Trainium、TPU、MTIA)与英伟达 GPU 阵营的边界,正在从「二选一」变成「混布」。

四、10 万颗 GPU:美国政府主权 AI 工厂​

合作中专门划出一块公共部门业务:AWS 与英伟达将为美国政府建造 AI 工厂,在安全 AWS 基础设施上部署 10 万颗 GPU,承载联邦与国家安全负载(Impact Level 6 及以上),支持在强监管框架内开发先进 AI 模型。

主权 AI 从口号变成明确数字,是本轮周期的显著特征——政府客户正在成为 AI 算力的一等买家。

五、软件与物理 AI 同步深化​

硬件之外,软件层合作也在加码:

  • NVIDIA Nemotron 开源模型继续登陆 Amazon Bedrock 与 SageMaker
  • Amazon EMR 数据处理与 OpenSearch 向量索引用 cuDF / cuVS 加速
  • Amazon Robotics 正式采用 NVIDIA 物理 AI 平台(Jetson、Omniverse、Isaac),用于仓储自动化与下一代机器人

物理 AI(机器人、具身智能)正在成为云厂商算力叙事的新增长极,这与国内京东、特斯拉等把具身智能写进算力采购逻辑是同一趋势。

六、对算力买家的启示​

观察含义
需求「跑赢所有预测」供给紧张不是短期现象,2027-2028 的算力窗口现在就要锁定
三代架构混采Rubin/Rubin Ultra 量产爬坡期间,Blackwell Ultra 仍是交付主力,采购需要跨代规划
CPU 层被重估agentic AI 把瓶颈从 GPU 推向 CPU 编排与内存带宽,选型时别只盯加速卡
主权 AI 落地政府级订单入场,进一步收紧高端 GPU 的可分配供给

对自建与租用的决策者而言,云巨头的每一次天量加购都在重定价未来的租金曲线。如果你正在评估 GPU 采购或租用方案,建议用 TCO 计算器 做一次量化测算:输入芯片价格、功耗、利用率与租用单价,即可对比 3 年持有成本。

小结​

200 万颗 GPU、Vera CPU 上云、NVHBM 开放、10 万颗主权算力——AWS 与英伟达这轮扩盟把「AI 工厂」竞赛推进到全栈时代。算力的稀缺性在 2027 年之前大概率只紧不松,无论是买卡、租卡还是押注国产替代,尽早锁定供给与成本曲线,都是当前最确定的动作。

(本文数据均来自 AWS/NVIDIA 官方公告与双方高管公开表态;架构性能口径以厂商发布为准。)