跳到主要内容

36 篇博文 含有标签「Tech Deep Dive」

Deep analysis of AI chip architecture, HBM, interconnect, packaging

查看所有标签

Helios 机架架构全解:72颗 MI455X、31TB HBM4、UALink 开放生态对垒 NVL72

· 阅读需 7 分钟
Industry Research Team

当 AI 竞争的单元从单颗 GPU 升级为整个机架,机架架构就成了新的战场。AMD 的答案叫 Helios:72 颗 MI455X、18 颗 EPYC Venice、31TB HBM4,外加一条与 NVIDIA NVLink 完全不同的开放互联路线。本文拆解它的技术细节、工程约束与商业兑现节奏。

从 GPU 到机架:AI 基础设施的竞争单位变了​

大模型训练与推理的规模已经远远超出单卡甚至单服务器的能力范围。万亿参数模型的训练需要数百到数千颗 GPU 高速协同,推理集群则要求在机架级完成模型分片与流量调度。于是 NVIDIA 用 NVLink 与 NVL72 把竞争拉到了机架层,而 AMD 在 2026 年 1 月的 CES 上给出了自己的回答——Helios,并在 Advancing AI 2026 上确认了完整规格。

Helios 的核心配置一目了然:

组件配置
GPU72 颗 MI455X(CDNA 5,每颗 432GB HBM4)
CPU18 颗 EPYC "Venice"(Zen 6,最高 256 核)
AI 网卡Pensando Vulcano 800G AI NIC
HBM4 总容量31TB
FP4 推理算力2.9 EFLOPS
FP8 训练算力1.4 EFLOPS
每 GPU 显存带宽23.3TB/s
Scale-up 总带宽260TB/s
Scale-out 带宽43TB/s(较竞品多 50% 以上)

单机架 2.9 EF FP4 的推理算力意味着,一个 Helios 机架可以完整运行 700B 级模型;31TB HBM4 则为超长上下文、多模态与 MoE 架构提供了充裕的显存池。

三级部件:MI455X、Venice 与 Vulcano​

Helios 的性能来自三个部件的协同设计。

MI455X 是算力核心。每颗 GPU 基于 CDNA 5 架构,采用台积电 N2 计算芯粒加 N3P I/O 与缓存芯粒的混合封装,3200 亿晶体管,432GB HBM4 配 23.3TB/s 带宽,MXFP4 算力 40 PFLOPS 级。72 颗的规模使其成为目前单机架密度最高的 AI 算力方案之一。

EPYC Venice 是主机侧大脑。这款全球首款 2nm 数据中心 CPU 基于 Zen 6 架构,最高 256 核、1GB L3 缓存、16 通道内存提供 1.6TB/s 带宽,CPU 到 GPU 互联带宽是上一代的 2 倍。在 Helios 中,每托盘 4 颗 GPU 配 1 颗 Venice,18 颗 CPU 负责数据搬运、内存管理与系统调度。

Pensando Vulcano 是网络出口。800G AI NIC 负责 scale-out 侧的横向扩展,前代 Pollara 400G 已在 MI300 系列上验证了 AMD 网卡路线,Vulcano 将单卡带宽翻倍,并深度配合 UALink 协议栈。

Helios 最具战略意义的设计是互联方案:采用 UALink over Ethernet(UALoE)实现 scale-up 纵向扩展,单 GPU 纵向扩展带宽 3.6TB/s,横向扩展 600GB/s(由三块 800G Vulcano NIC 提供);整个机架的 scale-up 总带宽达 260TB/s,scale-out 达 43TB/s——后者比同级竞品高出 50% 以上。

UALink 是 AMD 联合 Broadcom、Intel 等共同推动的开放标准,目标是打破 NVLink 的封闭生态。选择"UALink 跑在以太网上"而非另起炉灶的专有协议,有三层考量:

  1. 生态复用:数据中心以太网的技术栈、运维体系与供应链已经高度成熟,复用以太网物理层可以大幅降低部署门槛。
  2. 供应商多元:开放标准意味着交换芯片、网卡、线缆可以有多个供应商,客户不再被单一家族的网络产品绑定。
  3. 与 OCP 协同:UALink 与 OCP 的机架规范天然衔接,形成从芯片到机柜的完整开放栈。

与之对照,NVIDIA 的 NVLink 路线追求极致的私有优化——每 GPU 互联带宽更高、协议延迟更低,但代价是生态锁定。两条路线的胜负,取决于开放生态的成熟速度能否追上垂直整合的性能优势。

44OU ORW 机架:被物理约束塑造的工程设计​

Hot Chips 2026 上披露的机架工程细节,展示了巨型 AI 系统在数据中心物理约束下的真实样子。

工程维度Helios 机架参数
机柜规格44OU ORW 双宽机架(Open Rack Wide v3)
托盘布局18 个计算托盘 + 6 个交换托盘
散热全液冷 + 液冷快速接头
供电50V 直流母线
整机重量超过 7000 磅

这组数字背后是严酷的物理现实。72 颗高功耗 GPU 加 18 颗 CPU 使机架功率达到 225-245kW,传统风冷在如此功率密度下已经无能为力,全液冷成为唯一选项,液冷快速接头则是为了支持托盘级热插拔维护——在价值 500 万美元以上的机架中,停机时间就是真金白银。

50V 直流母线的选择同样有讲究:相比传统交流配电,直流母线减少一次 AC-DC 转换损耗,且在高功率密度下配电铜排更省空间。而超过 7000 磅的整机重量,则意味着数据中心的地板承重、搬运路线乃至建筑结构都需要为此重新评估——这也是它与 Meta 共研 ORW(Open Rack Wide)设计的意义:让宽体机架成为行业可复用的开放标准,而不是每家云厂商各造一套。

量产节奏与客户版图​

Helios 的交付节奏已经进入兑现期:2026 年 7 月开始量产,Q3 末首批出货,Q4 放量。客户侧的版图同样清晰:

  • 微软:2026 年 7 月宣布扩大合作,在 Azure 大规模部署 Helios 机架级系统,明确用于前沿模型推理而非训练。
  • Oracle:被列为 Helios 早期采用者。
  • OpenAI:6GW 级合作协议,首批 1GW 基于 MI450 系列,计划 2026 年 Q4 启动 Helios 规模化上架,2027 年进入加速投放周期。
  • Meta:最多 6GW 的 AMD GPU 部署计划,正测试 Helios 机架与第六代 EPYC,并与 AMD 共研基于 MI450 架构的定制加速器。
  • TCS:将 Helios 带到印度市场。
  • HPE:开放机架合作,加入 Dell、Supermicro、Lenovo 的 OEM 阵容。
  • 主权 AI:Helios 平台也将助力美国主权 AI 工厂超算建设。

OpenAI 与 Meta 合计 12GW 以上的合作规模,是检验 Helios 商业模式的试金石。AMD 用认股权证与战略投资绑定头部客户的模式(如向 OpenAI 发行最多 1.6 亿股认股权证),本质是把未来收入与客户增长深度绑定——如果兑现,AMD 将在 AI 加速器市场获得实质性的第二供应商地位。

小结​

Helios 不只是一台更大的机柜,而是 AMD 对 AI 基础设施的一次完整表态:用 UALink 与 OCP 的开放标准对抗 NVLink 的垂直整合,用显存容量与 scale-out 带宽的数字优势切入推理市场,用与 Meta 共研的 ORW 机架设计把工程经验沉淀为行业规范。7000 磅的重量、50V 直流母线与全液冷快速接头提醒我们,AI 竞争已经深入到供电、散热与承重这样的物理细节。接下来真正的问题只有一个:6GW 订单的兑现节奏,能否跟上纸面参数的漂亮程度。

互联标准战争:NVLink、UALink、UEC 与灵衢的四方博弈

· 阅读需 6 分钟
Industry Research Team

当单芯片晶体管增速放缓,算力的增长叙事就从"更快的芯片"变成"更多的芯片"——而把几百上千颗芯片粘成一台计算机的那根线,正成为 AI 基础设施竞争最激烈的一层。

为什么 scale-up 互联成为新战场​

大模型训练与推理的本质是大量芯片协同计算,芯片间每次交换数据都要经过互联网络。互联带宽决定了两件事:并行扩展效率(加卡能换来几成算力)和内存池化能力(跨卡显存能否当作一块用)。华为马尔科夫实验室的仿真给过一个直观口径:传统 8 卡服务器组网下,集群内通信占训练时间超过 40%;换成大规模超节点组网后 MFU 可提升 2.75 倍——互联不是配套件,而是算力本身。

于是"机架级计算"成为 2026 年的主流形态:NVIDIA 的 NVL72、AMD 的 Helios 72 卡机架、华为的 4096 卡超节点,都是在互联层下注。四方标准就此正面相遇。

四方标准对比表​

维度NVLink 6(NVIDIA)UALink / UALoE(AMD 阵营)Ultra Ethernet(UEC)灵衢 UnifiedBus(华为)
单卡带宽Rubin R200 单 GPU 3.6TB/sMI455X 单 GPU scale-up 3.6TB/s(UALoE);横向扩展 600GB/s以太网生态扩展,43TB/s 级机架出口昇腾 950/960 单卡 2TB/s
机架级带宽NVL72 总计 260TB/sHelios 72 卡 scale-up 约 260TB/s、scale-out 43TB/s以太网交换机标准演进960 超节点 4096 卡,RTT 2μs
开放度NVLink Fusion 向伙伴开放集成自定义 CPU/芯片UALink 开放规范,UALoE 走以太网物理层开放联盟,多厂商互通开放灵衢 2.0 总线生态,自研为主
生态绑定深度绑定 CUDA绑定 ROCm + OCP 开放标准生态最广、厂商中立绑定 CANN/MindSpore
代表系统Vera Rubin NVL72AMD Helios(Open Rack Wide v3)UEC 联盟成员网络Atlas 960 超节点

两组数字颇有意味:NVIDIA 与 AMD 的单 GPU scale-up 带宽同为 3.6TB/s,72 卡机架级 scale-up 带宽同样约 260TB/s——在纵向扩展这一层,两条路线的物理指标已经打平,胜负手转向开放度与生态。

开放标准与垂直整合的两条路线​

NVIDIA 走的是垂直整合加有限开放:NVLink 6 从交换芯片到拓扑全部自研,NVL72 的 260TB/s 全互联带宽是系统级护城河;但 NVLink Fusion 开始向合作伙伴开放,允许第三方把自定义 CPU、加速芯片接入 NVLink 域——既保住标准控制权,又吸纳外部设计。

AMD 走的是彻底的开放标准路线。Helios 机架基于 OCP 的 Open Rack Wide v3 规范(ORW 设计与 Meta 共研),互联组合是 Infinity Fabric + UALink + Ultra Ethernet,配自研 Pensando Vulcano 800G 网卡;MI455X 的 UALoE(UALink over Ethernet)干脆把 scale-up 流量架在以太网物理层上,让客户用标准以太网设备搭建 260TB/s 的纵向扩展域。UEC 则从横向扩展切入,目标是让万卡级集群的跨机网络也走开放以太网。

华为灵衢是第三条路:自研协议、开放生态。灵衢 2.0 总线支撑昇腾 950 的 2TB/s 单卡互联与 1024 卡超节点,昇腾 960 超节点用"灵衢 + Hi-ONE 光引擎"做到单节点 4096 卡、1PB HBM、RTT 2μs,多节点经灵衢网络组网最大 51.2 万卡,叠加多轨道拓扑可达 100 万卡集群——在规模上限上反而是四者中最激进的。

Token Fabric 的"中立性"悖论​

2026 年 10 月 8 日,多厂商互联平台 Upscale AI 发布 Token Fabric,NVIDIA 也出现在投资方名单里。它试图提供一个厂商中立的机架级互联方案,让不同家的加速器共处一个 scale-up 域。

但这里存在一个悖论:真正需要中立方(被 NVLink 锁定的二线芯片厂商)欢迎它,而制定标准的头部厂商(正是 NVLink、UALink、灵衢的持有者)都有动机让它名存实亡。NVIDIA 参投 Token Fabric 更可能是防守性布局——与其被排除在开放阵营外,不如进去施加影响。互联标准的"中立平台"能否存活,取决于超大规模云厂商是否愿意为去锁定支付溢价;从 OCP 阵营的扩张速度看,至少在 AMD Helios 这类系统上,开放路线已经拿到了第一个规模化验证。

给采购方的评估维度​

面对四方标准,采购方可以用四个维度打分:一是 scale-up 域内的有效带宽与扩展效率(MLPerf 等实测口径,Rubin NVL72 在 288 卡演示中达到 99% 扩展效率);二是内存池化能力——互联是否支持跨卡统一编址,这直接决定超大模型的部署方式;三是生态绑定成本——CUDA/ROCm/CANN 的迁移代价往往比硬件差价更大;四是供应链弹性——开放标准(UALink/UEC/OCP)意味着多供应商议价权,垂直整合意味着更紧的集成但更少的集成风险。

小结​

互联标准的四方博弈,本质是三种产业模式的对撞:NVIDIA 的垂直整合加 NVLink Fusion 有限开放,AMD 阵营的 UALink/UEC/OCP 全开放路线,华为的自研灵衢加超节点规模策略。物理指标上单卡 3.6TB/s、机架 260TB/s 已成 2026 年的"对齐线",下一阶段的差异化将来自光互联(Hi-ONE 的 NPO 路线)和内存语义扩展。对采购方而言,标准之争没有旁观席——今天选的互联,决定了未来五年被谁的生态锁定。

互联网巨头自研芯片盘点:百度昆仑芯 R200 与阿里平头哥真武 V900

· 阅读需 7 分钟
Industry Research Team

当英伟达的高端芯片被出口管制挡在门外,中国的互联网巨头们被迫回答同一个问题:算力从哪来?百度和阿里给出的答案最彻底——自己造。一家走自研 XPU 架构的渐进路线,一家以 RISC-V 基因押注全栈闭环。2026 年秋,两家的代表作品分别是昆仑芯 R200 和平头哥真武 V900。

一、巨头自研的三种路线​

把国内互联网巨头的芯片战略摊开,大致可分为三种类型:

路线代表特征
XPU 架构派百度昆仑芯自研指令集架构,从推理切入逐步上探训练
RISC-V + 全栈派阿里平头哥自研 CPU(倚天)+ AI 芯片(真武)+ 互联总线(ICN)全栈闭环
租赁过渡派腾讯自研(紫霄)同时大规模租用海外算力过渡

海外巨头的对照同样值得一看:Meta 与博通合作自研 MTIA 推理芯片,AWS Annapurna 团队与 NVIDIA 合作开发 NVHBM 定制芯片——"自研 + 深度定制"是大厂绕开通用 GPU 溢价的共同选择。而腾讯则提供了一个反例参照:通过租用 Oracle 旗下 10 万颗芯片获得算力,以租赁模式绕开采购限制。三条路线没有绝对优劣,但百度与阿里的坚持,正在长出最完整的技术资产。

二、百度昆仑芯:从 R200 到 P800 的 XPU 演进​

昆仑芯的底层竞争力在于自研 XPU 架构——从 2018 年的昆仑芯 1 代(14nm)到 2021 年的 2 代(7nm Kunlun Core II),再到今天的 XPU-R 与 XPU-P,指令集始终自主。本站收录的两代代表产品:

昆仑芯 R200(2025 年,XPU-R 架构,推理主力):

项目参数
制程7nm
FP3232 TFLOPS
FP16128 TFLOPS
INT8256 TOPS
显存16GB / 32GB GDDR6,512 GB/s
TDP150 W(被动散热)
视频108 路 1080P 解码 / 27 路编码
接口PCIe Gen4 x16

150W 的低功耗加多精度配置,让 R200 主打数据中心大规模推理与视频分析场景——这是百度搜索与信息流业务的算力基本盘。

昆仑芯 P800(2024 年,XPU-P 架构,训推一体):FP16 345 TFLOPS(超越 H20 的 148 TFLOPS)、INT8 820 TOPS、96GB HBM3、2.4 TB/s 带宽、400W、OAM 形态,支持 DeepSeek-V3/R1 671B 满血版单机 8 卡运行,配套天池 256/512 超节点,已交付万卡级集群并实现全自研三万卡集群。昆仑芯科技已于 2026 年 5 月启动科创板 IPO 辅导——从百度内部部门到独立上市,XPU 路线完成了商业验证。

三、阿里平头哥真武 V900:216GB 显存与 50 万卡集群​

2026 年 9 月 22 日云栖大会,平头哥发布新一代训推一体 AI 芯片真武 V900,官方称之为"目前算力性能最强的中国自研 AI 芯片",量产上云时间较原路线图提前至 2027 年第一季度。

项目参数
显存216 GB(超过 B200 的 192GB 与 H200 的 141GB)
片间互联1200 GB/s(自研 ICN 链路,较 M890 提升 50%)
精度原生 FP8 / FP4
性能口径真武 M890 的 3 倍
集群磐久 AL128 超节点,ICN Switch 扩展至 50 万卡
量产2027 年 Q1 上云
软件T-Head SAIL 全栈

与 M890 一致,平头哥未公布绝对 FLOPS、制程与 TDP——业界推测由中芯国际制造,官方未证实。但结构性的信息已经足够:216GB 显存直指大模型时代的"内存墙",1200 GB/s 片间互联对标 NVLink 量级拆解"通信墙"。真武系列的代际节奏同样清晰:810E(96GB/700 GB/s)→ M890(144GB/800 GB/s,GP9A 超节点实例已于 8 月上线,国内首个跑通超 2 万亿参数大模型的超节点形态算力)→ V900 → J900(2027 年 Q3,架构突破性创新)。截至 2026 年 9 月,真武系列已服务超 650 家企业客户。

四、ICN 总线与倚天 CPU:全栈闭环的最后一块拼图​

真武 V900 最大的想象空间不在单芯片,而在 ICN 互联总线构建的全栈闭环:ICN Switch 让 Scale-Up 域内带宽完全对称、原生内存语义与统一编址;磐久 AL128 超节点把真武 V900、ICN Switch、磐脉智能网卡、镇岳 SSD 主控全部收进一套算-存-网协同体系,单一集群可扩展至 50 万卡——这个目标直指 NVIDIA Rubin Ultra NVL576 的规模层级。

同期公布的倚天 CPU 路线图补上了 CPU 侧的拼图:2027 年推出倚天 720/730,其中倚天 730 首次采用全自研微架构,SPECint2017 单核性能(每 GHz)达到倚天 710 的 1.4 倍;倚天 750 支持自研 ICN 总线,实现 CPU 与真武 AI 芯片直连。至此,"倚天 CPU + 真武 AI 芯片 + ICN 网络"的全栈闭环成型——阿里成为国内唯一在 CPU、AI 芯片、互联协议三层都实现自研并互操作的云厂商。

五、对照与启示:自研是巨头的长期主义​

把百度与阿里放回全球坐标系:Meta×博通 MTIA、AWS×NVIDIA NVHBM 说明自研 + 定制是全球巨头的共同选择;腾讯租用 Oracle 10 万颗芯片则展示了"买不到就租"的过渡形态。但中国的特殊性在于出口管制的硬约束——通用 GPU 的获取不确定性,让自研从"降本选项"变成了"生存选项"。百度用 XPU 架构证明渐进路线的可持续,阿里用 RISC-V 基因 + ICN 总线证明全栈闭环的可能性。

小结​

昆仑芯 R200 与真武 V900 分别代表了互联网巨头自研芯片的两个时态:R200 是"现在时"——150W 低功耗推理卡稳定承载着百度的核心业务;V900 是"将来时"——216GB 显存、50 万卡集群与 2027 年 Q1 量产的承诺,瞄准的是数万亿至十万亿参数模型的算力底座。一种路线靠架构自主渐进上探,一种路线靠全栈闭环规模突围,两者共同指向同一个结论:中国互联网巨头的算力命门,正在从采购谈判桌转移回自己的设计图纸。2027 年,当 V900 与倚天 730 如期上云、昆仑芯 R300 落地,这场自研竞赛的下半场才真正开始。

从风冷到液冷:AI 机柜功耗狂飙下的散热革命

· 阅读需 7 分钟
Industry Research Team

十年前一个标准机柜 5-10kW,风冷绰绰有余;今天 Vera Rubin NVL72 约 180kW,AMD Helios 机架 225-245kW,下一代 Rubin Ultra NVL576 更是直指 600kW。散热从"机房辅助工程"升格为"AI 算力的第一性约束",一场从风冷到液冷的革命已不可逆。

为什么风冷在 100kW+ 机柜面前失效​

风冷的物理极限很好理解:空气比热容小、密度低,带走同样热量需要的体积流量巨大。机柜功耗超过 100kW 后,风冷会同时撞上三堵墙:

  1. 风量墙:单机柜 100kW 需要的冷风量超出地板下送风与机柜前门的物理供给能力,冷热气流短路、局部热点不可避免;
  2. 噪音与能耗墙:暴力风扇转速拉满,风扇功耗可占整机 10% 以上,机房噪音远超职业健康标准;
  3. 芯片密度墙:单卡 TDP 已从 H100 的 700W 涨到 Rubin R200 的 1800-2300W——这个量级的芯片,散热器与芯片之间的空气层本身就是绝热层,风冷在物理上无法把 2000W 从 die 表面带走。

结论很直白:当单卡功耗突破千瓦级、机柜突破百千瓦级,液冷不再是选项,而是必需品。NVIDIA 对 Rubin R200 的官方口径就是四个字——必须液冷。

机柜功耗演进:五年 100 倍的狂飙​

平台机柜功耗散热方式
传统服务器机柜5-15 kW风冷
GB300 NVL72~140 kW液冷为主
Vera Rubin NVL72(VR200)~190-230 kW全液冷
Rubin Ultra NVL576~600 kW全液冷 + 新一代供电

这条曲线(Thunder Compute 汇总口径)解释了为什么整个产业链都在围绕散热重构:机柜每上一个台阶,供配电、冷却水路、机房承重全部要重新设计。值得一提的是,散热还有"另一种解法"——华为昇腾 960 超节点用 NPO 光互连替代 4.8 万颗 800G 光模块,直接省下 550kW:最好的散热,有时是不产生这份热量。

技术梯队:冷板、浸没式与侧门冷却​

液冷按冷却介质与发热元件的距离分为三档:

技术方案原理散热能力改造成本成熟度
冷板液冷冷水板贴住 GPU/CPU 等高热元件单柜 100-300kW中主流量产方案
侧门冷却(Rear Door HX)机柜后门内置水冷换热器冷却排风单柜 50-150kW低过渡方案
浸没式液冷整机浸入介电液体极高,且可回收余热高特定场景试点

当前产业主流是冷板液冷:GPU、CPU 等热源元件用冷板覆盖,其余内存、硬盘仍靠风冷辅助,形成"液冷为主、风冷兜底"的混合形态。它的优势是可以在现有服务器形态上渐进改造,且不改变元器件可维护性。浸没式散热能力天花板最高、PUE 可逼近 1.05,但介电液体成本、服务器浸入后的可维护性与承重要求,使其仍局限于特定高密度场景。侧门冷却则是风冷机房"续命"的过渡选项。

50V 直流母线与液冷快速接头:工程细节里的魔鬼​

散热革命从来不只是"换水冷板",它牵动整机柜的供电与水路重构。AMD Helios 机架的工程细节最具代表性:

  • 44OU ORW 双宽机架:采用 Open Rack Wide v3 标准,机架宽度加倍,为 72 颗 MI455X + 18 颗 EPYC Venice 留出空间;
  • 18 个计算托盘 + 6 个交换托盘:计算与网络托盘分层布置,托盘化设计让故障节点可整体抽出更换,水路随托盘断开;
  • 液冷快速接头:每个托盘使用免工具快速接头,拔插自动密封不漏液——这是液冷能否规模化运维的关键:机房不可能为换一张卡而整体排水;
  • 50V 直流母线:整机柜采用 50V 直流配电架构,替代传统多级 AC-DC 转换,减少变换级数、提升供电效率,与 NVIDIA 侧的 800V HVDC 演进方向殊途同归;
  • 重量超 7000 磅(约 3.2 吨):装满冷却液与 72 颗 GPU 的机架对机房楼层承重提出全新要求,液冷机柜的"体重"本身就是部署约束。

Helios 机柜 TDP 225-245kW,与 Vera Rubin NVL72 的约 180kW 处在同一量级——头部厂商已默契地收敛到"百千瓦级液冷机柜 + 直流母线供电"的新范式。

功耗-散热-电力:三级约束链​

机柜功耗狂飙的尽头是电网。当前 AI 数据中心面临一条层层传导的约束链:

芯片功耗 → 机柜散热能力 → 机房电力容量 → 区域电网供给。

  • 电力缺口:部分新建数据中心等不及电网扩容——Oracle 用燃气卡车"运电"应急;戴尔与日本 Jera 合作投资 150 亿美元在东京建设 400MW 离网 AI 数据中心,自含燃气电厂,计划 2028 年运营。算力需求已快到"自己发电"的地步;
  • 联盟与标准:AEMA(电网响应联盟)推动数据中心参与电网调峰响应;NVIDIA 则以 DSX 平台展示能效路线——同功率下 token 吞吐提升 24%、每瓦性能提升 23%,证明"省电"的最前沿其实在芯片与系统层;
  • 散热的边界:每一瓦耗电最终都要变成一瓦热,被冷却系统搬运到室外。PUE(总耗电/IT 耗电)每降 0.1,就意味着数千千瓦的冷量系统节省——这也是为什么液冷的 ROI 不能只算电费。

三级约束环环相扣:电网约束机房选址,机房电力约束可部署机柜数,散热能力约束单机柜能塞进多少卡——最终都折算成你能买到的算力总量。

给部署方的建议​

  1. 按液冷标准规划新机房:新建设施直接按 150kW+/机柜的液冷密度设计承重、水路与管井,避免两年后推倒重来;
  2. 冷板优先,浸没观望:冷板液冷生态与运维成熟度最高;浸没式适合高密度推理等特定负载,不建议作为通用方案首批落地;
  3. 关注直流供电架构:评估机柜级 50V 直流母线或更高压 HVDC 方案,转换级数越少,长期电费与可靠性收益越大;
  4. 把 PUE 纳入采购决策:本站的 TCO 计算器支持设置 PUE 参数,输入机柜功耗与 PUE 后即可模拟五年电费差异——液冷机柜贵出来的那部分钱,往往两三年内就会被电费差价抹平;
  5. 别忽略"减热"路线:光互连(如 NPO 省电 550kW)、更高能效芯片(每瓦性能提升 23% 的系统级优化)同样是散热压力的解药,买算力时把系统能效纳入比价。

小结​

AI 机柜功耗从 100kW 冲向 600kW 的曲线,把散热从幕后推向台前。冷板液冷成为主流范式,50V 直流母线与快速接头定义了新一代机柜工程标准,而电网约束则把战场延伸到能源侧——燃气电厂进园区、调峰联盟成立、每瓦性能成为核心 KPI。未来的 AI 算力竞争,本质上是"每瓦 token"的竞争:谁能更高效地把电变成热、再把热搬走,谁就能部署更多算力。

HBM-DRAM-NAND 三层重构:KV Cache 如何改变存储金字塔

· 阅读需 6 分钟
Industry Research Team

过去十年,存储金字塔的分工非常清晰:HBM 伺候计算核心,DRAM 扛系统内存,NAND 做持久化。2026 年,Agentic AI 的 KV Cache 把这条界线搅得七零八落——上下文越来越长,显存越来越装不下,HBM-DRAM-NAND 三层正在被重新定义。

Agentic AI 的 KV Cache 问题​

传统聊天机器人的一次请求,上下文不过几千 token;而 Agent 的工作方式是在一个会话里连续执行几十步任务——浏览网页、读写文件、调用工具、自我反思——每一步都要携带完整的对话历史。上下文从 8K 涨到 100 万 token(NVIDIA RTX Spark 已支持最长 100 万 token 上下文),KV Cache 的体积也随之线性膨胀。

问题在于 KV Cache 必须常驻显存才能避免重复计算。以 Rubin R200 为例,它配备 288GB HBM4、带宽 22TB/s,看似充裕,但在多路并发服务时,模型权重占掉一块,剩余空间很快就会被活跃会话的 KV Cache 吃满。上一代 Blackwell Ultra(B300)之所以把显存从 192GB 提到 288GB HBM3e,官方场景里明确有一条就是"长上下文 KV Cache 288GB 完整保留"——显存的增长节奏,正在被 KV Cache 而不是模型参数牵着走。

当单卡显存装不下时,业界给出的答案是:别把 KV Cache 困在 HBM 里,让它沿着存储金字塔往下走。

三层金字塔:角色被重新定义​

Vera Rubin 平台是这场重构的最佳样本。它的"七芯片堆栈"包含 Vera CPU、Rubin GPU、NVLink 6 交换机、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 以太网交换机和 Groq 3 LPX,其中内存系统呈现清晰的三层结构:

层级介质代表硬件容量/带宽新角色
热数据层HBM4Rubin R200(8 堆栈)288GB / 22TB/s活跃 KV Cache、模型权重
温热数据层LPDDR5XVera CPU1.5TB / 1.2TB/sKV 缓存卸载、与 HBM 构成单一一致性内存池
冷数据层NAND(SSD)BlueField-4 驱动的推理上下文内存存储平台PB 级会话持久化与跨请求复用,token 吞吐最高提升 5 倍

关键变化有三点。其一,LPDDR5X 与 HBM4 之间建立了单一一致性内存池——Vera Rubin NVL72 机柜内,72 颗 GPU 共享 20.7TB HBM4,36 颗 Vera CPU 提供 54TB LPDDR5X,KV Cache 可以在不损失一致性语义的前提下在两层间流动。其二,BlueField-4 不再只是安全卸载卡,而是被定位为"推理上下文内存存储平台",把结束回合的会话上下文写入 NAND,下次请求命中时直接回灌,省去重新 prefill 的算力开销。其三,NAND 从"存储盘"升级为"上下文内存",这是金字塔底层几十年来第一次获得计算语义。

HBF、PIM、M900:案例对比表​

围绕这条三层链路,整个存储产业在 2026 年密集出招:

方案厂商技术要点目标场景
HBF(高带宽闪存)SK海力士(AI Infra Summit 2026 "New Spectrum" 组合)给 NAND 加上类 HBM 的超宽接口KV Cache 冷层,带宽接近 DRAM 量级
PIM 存内计算SK海力士在 DRAM 附近完成部分计算,减少搬运KV Cache 原地更新
eSSD + SALT-KVSK海力士面向 KV Cache 语义优化的键值存储栈推理上下文持久化
OceanStor M900华为上下文内存存储集群,灵衢总线一跳直连 PB 级 KV Cache,SSD 读写寿命延长 16 倍昇腾超节点的 KV 基建
NVHBM 定制内存AWS Annapurna × NVIDIA面向 AI 负载的定制 HBM 方案云厂商定制化
超密度服务器内存模组美光(2026-09-15)单模组容量再上一档DRAM 温热层扩容

SK海力士还专门设立了 SK hynix Ventures(9 月 18 日落地硅谷),用投资孵化初创公司的方式押注"内存即基础设施"这条新赛道。值得注意的是华为 OceanStor M900:它与昇腾 960 超节点同期发布,通过灵衢总线一跳直连,把 PB 级 KV Cache 集群变成超节点的"外挂记忆体",并通过磨损均衡等手段把 SSD 读写寿命延长 16 倍——上下文存储的写放大问题,第一次被当成显性的工程指标来攻克。

协同设计取代采购​

这轮重构背后,是产业关系的转向:存储不再是"按目录价采购的标准件",而是与加速器协同设计的定制组件。NVIDIA 联合 AWS Annapurna 做 NVHBM,华为为昇腾自研 HBM 并配套 OceanStor M900,SK海力士直接下场定义 KV 存储软件栈。美光甚至在 9 月的口径中预测 NAND 与 DRAM 短缺将持续到 2028 年——在供不应求的市场里,谁能锁定定制内存供给,谁就握住了推理产能。

对芯片厂商而言,算力竞争的上半场比的是 FLOPS,下半场比的将是"每 token 需要搬运多少字节"。带宽金字塔的每一层接口,都成了架构设计的一等公民。

对推理 TCO 的影响​

这套三层结构对成本模型的影响是直接的。第一,KV Cache 卸载到 DRAM 和 NAND 后,同样规模的 HBM 可以服务更多并发会话,单 token 的 HBM 摊销成本下降。第二,BlueField-4 上下文存储平台宣称 token 吞吐最高提升 5 倍,本质上是把重复 prefill 的 GPU 算力换成了廉价的 NAND 读取——用存储的"宽"换算力的"贵"。第三,内存已占整机 TCO 约 40%(HBM 涨价后的行业口径),存储分层做得越细,整体成本曲线越平缓。

小结​

KV Cache 正在把存储金字塔从"容量阶梯"改造成"温度阶梯":HBM 保活跃、DRAM 承接温热会话、NAND 做上下文持久化,三层之间以一致性内存池和专用存储平台(BlueField-4、OceanStor M900)贯通。SK海力士的 HBF/PIM/SALT-KV 与美光的超密度模组说明,存储大厂已经从跟随 AI 转向定义 AI 基础设施。下一阶段推理成本的胜负手,不在 GPU 的 FLOPS 表格上,而在三层存储之间的数据搬运路线上。

MI455X 深度解析:CDNA 5、432GB HBM4、40 PFLOPS MXFP4,AMD 数据中心旗舰全拆解

· 阅读需 8 分钟
Industry Research Team

2026 年 10 月,AMD 数据中心战略进入兑现期:MI455X 作为首款采用台积电 N2 制程的 AI GPU,正从发布走向量产。本文基于站内芯片卡数据,从制程、架构、显存、互联到量产供应链,全面拆解这款对标 NVIDIA Rubin 的旗舰产品。

产品定位:MI400 系列的旗舰担当​

MI455X 是 AMD 在 2026 年 7 月 23 日 Advancing AI 2026 大会正式确认的 Instinct MI400 系列旗舰,也是 Helios 机架的核心算力来源。它专为大规模 AI 训练与分布式推理而生,覆盖万亿参数大模型训练、低延迟高吞吐推理、强化学习与代理式 AI 等场景。相比上一代 MI355X,MI455X 的 FP4 峰值算力提升最高 4 倍,token 吞吐最高提升 18 倍,单位 token 成本最高可降 34 倍——这些数字背后,是 CDNA 5 架构对低精度计算时代的系统性重构。

从产品分层看,MI400 系列目前形成了清晰的矩阵:MI455X 面向前沿训练与推理(Helios 机架专用),MI430X 面向 HPC 与主权 AI(硬件 FP64 双精度),MI440X 面向企业级 8-GPU 服务器。MI455X 站在金字塔尖,承担着 AMD 与 NVIDIA Rubin 系列正面对抗的任务。

制程拆解:N2 计算芯粒 + N3P Fabric 的混合封装​

MI455X 最引人注目的标签,是"首款 TSMC N2 制程 AI GPU"。在 NVIDIA Rubin 仍停留在 3nm 节点的同期,AMD 选择在计算芯粒上抢跑 2nm,这是一步高风险高回报的棋。

从封装架构看,MI455X 采用多芯片模块(MCM)设计:

芯粒组件制程功能
8 个计算芯粒(XCD)TSMC N2(2nm),3D 混合键合承担矩阵与向量计算
2 个 I/O die(IOD)TSMC N3PI/O 与互联控制
2 个缓存/Fabric die(FCD)TSMC N3P缓存与 fabric 交换
12 颗 HBM4 堆栈—显存子系统

整颗 GPU 晶体管数量达到 3200 亿,采用 CoWoS-L 封装将所有芯粒与 HBM4 堆栈整合。把计算芯粒放在最先进的 N2 节点、把 I/O 与 fabric 放在成熟度更高的 N3P,是一种务实的成本-性能平衡:计算部分享受 2nm 的晶体管密度与能效红利,而互联与缓存部分避开 2nm 初期的良率与成本压力。

N2 抢跑的意义与良率风险​

抢跑 N2 的意义在于三个层面。第一,能效:2nm 芯片在同等功耗下提供更高算力密度,这对 TDP 高达 1200-1500W 级别、必须全液冷的 AI GPU 而言,直接决定机架功率预算。第二,先发卡位:台积电 N2 产能在 2026 年仍然紧张,AMD 与 EPYC Venice 共享 N2 产线,形成了对先进节点的规模化采购议价权。第三,叙事优势:在全球 AI 芯片竞赛中,"首款 2nm AI GPU"的头衔本身就是营销资产。

但风险同样真实。N2 初期的良率爬坡不确定性,会直接影响 3200 亿晶体管大芯片的良率成本;CoWoS-L 先进封装产能是另一个行业级瓶颈。AMD 的对冲方式正是多芯粒设计——单个 XCD 面积远小于单片巨芯,良率损失可控,这也是行业走向 chiplet 化的深层原因。

显存系统:432GB HBM4 与 23.3TB/s​

显存是 MI455X 相对 NVIDIA 最硬的数字优势。它配备 12 颗 HBM4 堆栈,每颗 36GB,总容量 432GB,是 NVIDIA Rubin R200(288GB)的 1.5 倍;显存带宽达 23.3TB/s,高于 Rubin 的 22TB/s。

对推理业务而言,大显存的意义是直接的成本优势:更大的模型可以完整驻留在单卡显存中,减少张量并行带来的通信开销。432GB 意味着 700B 级模型配合 FP4 量化可以在机架级完整加载,这也是 AMD 宣称"单机柜可运行 700B 模型"的底气。同时,HBM4 带宽从 MI355X 的约 8TB/s 跃升至 23.3TB/s,接近 3 倍,极大缓解了 LLM 推理中最常见的带宽瓶颈——在自回归解码阶段,每生成一个 token 都需要完整读出模型权重,带宽几乎线性决定推理速度。

CDNA 5 架构哲学:Wave32 与计算子系统的重构​

CDNA 5 架构最值得玩味的细节,是从上代 Wave64 转向 Wave32 原生执行。Wave 是 GPU 调度执行的基本单位,Wave64 意味着 64 个工作项打包在一个 warp 中调度。转向 Wave32 后,每条指令的调度粒度减半,寄存器分配更灵活,分支发散的代价更低,对不规则计算负载(如稀疏注意力、MoE 专家路由)更友好。这与推理时代工作负载日益动态化、稀疏化的趋势深度契合——当 AI 模型从稠密训练走向 MoE 与长上下文推理,执行单元的灵活性比峰值 FLOPS 更能决定实际性能。

配套的计算子系统升级同样系统化:

  • 超越函数引擎:将 exp、log 等非线性运算硬件化。softmax、RMSNorm、激活函数是大模型每个 transformer 层的必经之路,硬件化后这些操作不再占用通用计算资源,对推理延迟的改善立竿见影。
  • Tensor Data Mover:专门的数据搬运引擎,负责张量在显存、缓存与计算单元之间的流转,让计算单元专注于计算本身,减少等待数据的时间。
  • 192MB L2 缓存:是上代 MI355X 32MB 的 6 倍。更大的片上缓存意味着 KV Cache 与激活值可以更多驻留片上,降低对 HBM4 带宽的实际压力。

精度矩阵:MXFP4 时代的算力语言​

CDNA 5 支持 FP4、FP6、FP8 与 BF16 全精度矩阵计算。MI455X 的官方标准是 dense(密集)算力:MXFP4 40.26 PFLOPS、MXFP8 20.1 PFLOPS、FP16 矩阵 5 PFLOPS(结构化稀疏 10.1 PFLOPS)、FP32 向量 315 TFLOPS、INT8 矩阵 5 POPS。

这里有一个需要消费者警惕的口径问题:AMD 坚持 dense 口径,而 NVIDIA Rubin 同期产品以 sparse(稀疏)口径宣传。两边的数字不能直接比较。这也是 AI 算力市场长期存在的"数字游戏"——只有统一到 dense 口径,MI455X 与 Rubin 的对比才有意义。

与 NVIDIA Rubin R200 的正面对比​

把两款同代旗舰放在一张表里,格局会清晰很多:

对比项MI455X(CDNA 5)NVIDIA Rubin R200
计算芯粒制程TSMC N2(2nm)TSMC 3nm
晶体管数量3200 亿3360 亿
显存容量432GB HBM4288GB HBM4
显存带宽23.3TB/s22TB/s
FP4 算力40.26 PFLOPS(dense)50 PFLOPS(sparse,折算约 25 PF dense)
配套 CPUEPYC Venice(Zen 6,256 核)Vera ARM(88 核)
机架互联UALink 开放标准NVLink 封闭生态
软件生态ROCm 7/8CUDA 13
TDP未公开(直接液冷)未公开

AMD 的优势集中在显存容量、dense 口径下的 FP4 算力、开放互联与制程代际;NVIDIA 的护城河仍在软件生态成熟度与网络产品线。这款产品的胜负手不在纸面参数,而在 ROCm 生态能否承接住大规模迁移、以及量产爬坡速度。

量产进展与 HBM4 供应链​

根据 2026 年 10 月的量产进展信息,Helios 机架已于 2026 年 7 月开始量产,首批系统在 Q3 末出货,Q4 进入放量阶段。这一节奏兑现了 AMD 在 CES 2026 与 Advancing AI 2026 上的承诺,也让 OpenAI、微软、Oracle 等客户的部署时间表有了落地的物理基础。

供应链层面,三星是 AMD 的首选 HBM4 供应商:双方于 2026 年 3 月签署 MOU,三星 HBM4 已于 2026 年 2 月实现量产。CEO 苏姿丰在 10 月初亲赴首尔,追加 HBM4 供给谈判——这个时间点恰好卡在 Helios Q4 放量之前,显存供应成为交付节奏的关键变量。据报道,三星 HBM4 产能已售罄至 2029 年,三星目标在 2027 年将产能翻倍。在 HBM4 全面紧缺的 2026 年,谁能锁定更多显存堆栈,谁就能在 AI GPU 市场多抢下一个季度的份额。

小结​

MI455X 是 AMD 历史上第一次在制程节点(N2)、显存规格(432GB HBM4)、算力口径(dense 40 PFLOPS 级 FP4)三个维度同时与 NVIDIA 平起平坐甚至局部反超的产品。N2 抢跑与 Wave32 原生执行体现了 CDNA 5 面向推理时代的架构哲学,而量产爬坡与 HBM4 供应链则决定了这手好牌能打出多少实际价值。对采购方与开发者而言,2026 年 Q4 放量节点之后的真实交付数据与 ROCm 生态成熟度,才是验证 AMD 数据中心雄心的最终标尺。

寒武纪 MLU690 深度解析:700+ TFLOPS FP16 与国产训练卡的寒武纪时刻

· 阅读需 6 分钟
Industry Research Team

在华为昇腾与英伟达的双雄叙事之外,寒武纪正在写下国产 AI 芯片的第三条故事线:思元690 以 700+ TFLOPS FP16 登顶国产纸面算力,公司实现首次年度盈利,下一代芯片未发先涨 20%–30%。这个曾经靠情怀撑估值的"AI 芯片第一股",第一次同时握住了技术、商业与定价权三张牌。

一、思元690 核心规格:196GB HBM3 撑起的算力天花板​

按本站芯片卡收录的规格,思元690(MLU690)采用双 die Chiplet 封装,2026 年初量产,核心参数如下:

项目参数
架构新一代 MLUarch 架构
制程中芯国际 N+2(5nm 级),亦见台积电 4nm 双 die 报道
显存196 GB HBM3
显存带宽3.35 TB/s
FP16/BF16700+ TFLOPS
INT42800+ TOPS
互联MLU-Link 890 Gbps/卡
TDP400–500 W
单价¥14–15 万

与上代思元590 相比,这是一次全面换代;与 H100 相比,则是典型的"错位竞争":

指标思元690思元590H100 SXM对比 H100
显存196GB HBM396GB HBM2e80GB HBM32.45×
显存带宽3.35 TB/s~2 TB/s3.35 TB/s持平
FP16700+ TFLOPS345 TFLOPS989 TFLOPS~71%
INT8 推理反超(INT4 2800+ TOPS 口径)1380 TOPS1979 TOPS部分场景反超

196GB 显存是思元690 最锋利的差异化武器:单卡装下更大的模型与 KV Cache,在推理场景性价比突出;纯推理场景可达到 H100 的 80%–90%。短板同样清晰——FP16 训练算力与千卡以上分布式训练的互联工程成熟度。为此,WAIC 2026 上寒武纪同步落地了 256 卡规模超节点集群方案,已在多地智算中心部署,从"单卡算力"走向"系统级算力"。

二、架构演进:MLUarch 换代与 HBM3 上量​

思元690 的代际跃迁体现在三处:其一,MLUarch 架构换代(市场披露口径称新一代芯片采用 MLUarch 04),配合双 die Chiplet 封装,把晶体管预算投向张量算力与显存通道;其二,显存从 HBM2e 一举上量到 196GB HBM3,3.35 TB/s 带宽与 H100 持平——在国产供应链里率先解决"内存墙";其三,MLU-Link 890 Gbps 卡间互联已接近 NVLink 4 的 900 GB/s 量级,为 256 卡超节点铺路。软件侧的 NeuWare 是国内少有的云边端统一栈:PyTorch/TensorFlow 适配版、NeuBLAS、NeuDNN,以及全球首批商用 MLIR 图编译推理框架 MagicMind。

供应链上,台积电因实体清单停供后,寒武纪全线转向中芯国际 N+2,成为中芯先进制程的最大客户之一;N+2 产能已锁定至 2027 年。

三、涨价 20%–30%:国产芯片第一次掌握定价权​

路透社 2026 年 9 月 10 日报道:寒武纪下一代芯片(市场暂称"690")重新定价,较两个月前上涨 20%–30%。同期昇腾 950DT 报价突破 25 万元、沐曦、天数智芯等国产卡也集体上调 20%–30%——这不是寒武纪一家的孤例,而是 HBM 成本飙升叠加供不应求下的全行业现象。

值得注意的是官方态度:寒武纪董秘办回应"不要听信市场消息,一切以官方公告为准"。渠道价与官方定价之间存在明显温差——涨价是市场现实,但公司不愿为渠道炒作背书。这背后是国产 AI 芯片定价权的历史性变化:过去国产卡必须以"替代品折价"换取订单,如今供给稀缺让定价逻辑转向"稀缺溢价"。在华为、寒武纪、摩尔线程构成的国产三强格局中,寒武纪第一次拥有了"不降价也能卖动"的底气。

四、首次年度盈利:商业模式的拐点​

如果说涨价反映的是市场热度,盈利则验证了商业模式的成色。按 2026 年上半年行业复盘口径,寒武纪已实现首次年度盈利。配套数据同样亮眼:2026 年 Q1 营收 28.85 亿元,同比增长 160%;2026 年 6 月市值突破万亿元。客户结构上,字节跳动是最大客户(思元580/590/690 合计采购超 50 万颗,约占其采购的 65%),阿里、百度、中国移动相继进入订单名单。

"首次盈利"对国产 AI 芯片行业的标志意义在于:这个赛道第一次出现了不依赖补贴与融资、靠卖芯片本身赚钱的商业模式。研发投入可以自我造血,意味着产品迭代不再以资本耐心为限——这对动辄三年一代的芯片研发周期,是决定性的正循环。

五、命名之辨:思元系列与市场传闻的"690"​

最后回到一个细节:市场上热议的"690",官方从未正式发布命名。本站芯片卡以"思元690"收录其规格(已量产口径),而路透报道中的"690"实为市场对下一代芯片的暂称,寒武纪对具体命名、规格与定价均保持谨慎,一切以官方公告为准。这种"市场抢跑、官方缄默"的组合本身就是一个信号:在供给稀缺的卖方市场里,厂商不再需要靠预热造势——把名字留到正式发布,反而是一种定价权。

小结​

思元690 代表的"寒武纪时刻",本质上是三件事同时发生:技术上,700+ TFLOPS FP16、196GB HBM3 与 256 卡超节点让国产训练卡首次形成完整的系统级方案;商业上,首次年度盈利证明了国产 AI 芯片可以自我造血;市场地位上,20%–30% 的重新定价宣告国产芯片开始掌握定价权。当然,考验依然存在:千卡以上训练的互联工程成熟度、NeuWare 与 CUDA 的生态差距、以及下一代芯片能否如期放量。但至少在 2026 年秋天,国产 AI 芯片第一次同时拥有了技术、利润与议价能力。

摩尔线程双线作战:MTT S5000 智算卡与"庐山"图形 GPU 的AI+游戏并举

· 阅读需 6 分钟
Industry Research Team

当多数国产 AI 芯片公司all in 大模型算力时,摩尔线程依然坚持"两条腿走路":一手是 MTT S5000 智算卡撑起的夸娥万卡集群,一手是瞄准 3A 游戏的"庐山"图形 GPU。9 月初的半年度业绩说明会给出了两条线的最新坐标——这条"AI+游戏"并举的路线,正在从权宜之计变成差异化壁垒。

一、MTT S5000:平湖架构的训推一体旗舰​

MTT S5000 基于第四代 MUSA"平湖"架构,搭载 PH100 芯片、4096 个自研 MUSA Core,2025 年 2 月公开参数。核心规格如下:

项目参数
架构MUSA 第四代(平湖),PH100 芯片
显存80 GB(颗粒类型官方未公开)
显存带宽1.6 TB/s
FP8 稠密算力1000 TFLOPS(液冷版)/ 920 TFLOPS(风冷版)
BF16/FP16400 TFLOPS
FP32100 TFLOPS
INT8800 TOPS
互联MTLink 784 GB/s(8 卡节点内全互联)
TDP500 W(市场口径)
形态OAM / PCIe,液冷 + 风冷双版本
单价~$4000–6000(OAM)

几点澄清值得注意:其一,"单卡 AI 稠密算力 1000 TFLOPS"特指 FP8 精度(液冷版),并非 FP16;其二,80GB 显存的颗粒类型官方从未公布,市场流传的"GDDR6X"说法与 1.6 TB/s 带宽自相矛盾,本站已订正为"类型未公开";其三,S5000 配备硬件级 FP8 Tensor Core,支持 FP8→FP64 全精度,并已基于 FP8 完成 DeepSeek-V4 的 Day-0 适配。加上《安全可靠测评结果公告(2026 年第 2 号)》的通过——AI 训推芯片首次纳入该体系——S5000 同时拿到了信创市场的入场券。

二、万卡落地:夸娥集群与京东云合作​

S5000 的成色,最终要靠集群说话。基于夸娥(KUAE)万卡智算集群的实测数据:

指标实测值
集群算力10 EFLOPS
Dense 大模型训练 MFU60%
MoE 大模型训练 MFU40%
训练线性扩展效率95%(64 卡→1024 卡保持 90%+)
有效训练时间占比>90%
第三方对齐智源 RoboBrain 2.5 与 H100 集群 loss 差异仅 0.62%

95% 的线性扩展效率背后是 ACE 异步通信引擎——把通信任务从计算核心卸载,实现计算与通信零冲突并行。商业侧,2026 年 3 月签下 6.6 亿元夸娥集群订单;软件侧,MiniMax M3、智谱 GLM-5.2、阿里 Qwen3.5、美团万亿参数 LongCat-2.0 相继完成 Day-0 适配。最关键的落地信号来自 9 月 19 日:京东云与摩尔线程合作的万卡级集群已部署上线服务——从"能跑通"到"规模化服务外部客户",国产 GPU 集群跨过了商用验证的分水岭。随后的数贸会(9 月 23–27 日,杭州)上,摩尔线程集中展示了 AI 智算卡、万卡级集群,以及"模型训练工厂、词元生产工厂、智能体生产工厂"三层能力,产品覆盖云-边-端全场景。

三、"庐山"GPU:从兼容显卡到渲染范式革命​

图形产品线上,9 月 3 日半年度业绩说明会披露了新一代"庐山"GPU 的指标——基于花港架构,预计 2026 年底推出:

  • 3A 游戏渲染性能提升 15 倍;
  • 光线追踪性能提升 50 倍;
  • AI 性能提升 64 倍。

比倍数更重要的是两项渲染技术的组合:一是硬件光线追踪,原生支持 DirectX Raytracing,让国产 GPU 第一次在光追管线层面与主流标准对话;二是AI 生成式渲染 AGR,基于全自研 MTAGR 1.0,把渲染范式从"逐像素计算"推向"生成"——用 AI 直接生成画面内容,而非暴力算出每个像素。前者补齐了传统管线的硬件短板,后者则是在渲染范式切换窗口期的卡位:当英伟达 DLSS、AMD FSR 都在走向 AI 化时,AGR 让摩尔线程有机会在下一代渲染标准里占据一席,而不是永远追赶。

四、游戏反哺 AI:双架构复用的独特路线​

把两条产品线放在一起看,摩尔线程的打法浮现出独特逻辑:图形与 AI 共享同一套 MUSA 架构底座——SIMT 核心、张量单元、光追核心、统一软件栈全部复用。游戏 GPU 的价值因此不只是营收 diversification:海量游戏场景是最好的架构压力测试与现金流来源,图形侧打磨的调度、显存与光速能力,反向反哺 AI 卡的通用计算质量;而 AI 业务积攒的先进制程流片经验,又拉高图形芯片的天花板。

已登陆科创板的摩尔线程,如今可以用上市平台的融资能力同时养两条产品线。这与纯 AI 芯片公司"单点押注大模型"的路线形成鲜明对比——在国产算力需求旺盛但波动性尚存的市场里,双线作战既是对冲,也是壁垒。

小结​

摩尔线程的 2026 年验证了"全功能 GPU"路线的可行性:MTT S5000 以 FP8 稠密 1000 TFLOPS、80GB 显存撑起夸娥万卡集群,并通过京东云万卡级集群部署完成了规模化商用验证;"庐山"GPU 则以硬件光追与 AI 生成式渲染 AGR 完成了从"国产兼容显卡"到"渲染范式探索者"的技术跃迁。图形+AI 双架构复用的独特路线,让摩尔线程在国产 AI 芯片阵营中占据了一个难以复制的生态位。2026 年底"庐山"如期推出与否,将是这条双线故事的下一次大考。

光进铜退:NPO/CPO 光互连如何重塑超节点架构

· 阅读需 7 分钟
Industry Research Team

当超节点从 72 卡扩张到 4096 卡,铜缆互连在功耗与距离面前彻底缴械。2026 年 9 月,华为发布全球首个采用 NPO(近封装光学)技术的超节点,用 5500 个光引擎替代 4.8 万颗 800G 光模块、省电 550kW——"光进铜退"从口号变成了工程现实。

可插拔光模块的功耗天花板​

传统数据中心组网依赖可插拔光模块:交换机面板上插着 400G、800G 的模块,通过光纤连接各节点。这套体系成熟、可维护,但在 AI 超节点规模下撞上了天花板。

华为披露的数字最具说服力:若用传统方案支撑昇腾 960 超节点的组网需求,需要约 48000 颗 800G 光模块。每颗 800G 可插拔模块功耗约 15-25W,4.8 万颗意味着仅光互连部分就要消耗兆瓦级电力,还不算 SerDes 链路、面板空间与故障率代价。更进一步,可插拔模块的 DSP 重定时环节占据了模块功耗的大头,且离交换芯片越远、信号损耗越大——模块越密,这场"功耗税"越重。

对于动辄数千卡、训练十万亿参数模型的超节点而言,光互连的功耗与可靠性直接决定了系统能建多大。这就是"光进铜退"的起点:把光引擎从面板挪到芯片身边,甚至塞进封装里面。

NPO、CPO、OIO:光互连技术梯队​

按光引擎与芯片的距离由远及近,光互连分为三个梯队:

技术方案光引擎位置功耗收益工程成熟度代表
可插拔光模块交换机面板基线成熟,生态完整传统数据中心组网
NPO 近封装光学封装旁的基板上显著降低,光源独立可换已量产昇腾 960 超节点 Hi-ONE
CPO 共封装光学与交换芯片同封装最大幅度降低可靠性/可维护性待解各厂商交换机路线图
OIO 光 IO进入 GPU/芯片封装内部终极形态研究与早期验证下一代超节点探索

NPO 与 CPO 的核心差异在于取舍:CPO 把光引擎与芯片放在同一封装,光电距离最短、功耗最低,但激光器故障要更换整个昂贵封装,可靠性与可制造性一直是拦路虎;NPO 则把光引擎放在封装之外的基板上,保留"独立可插换"的维护性,同时实现光电近距离握手。华为明确解释过为何 960 超节点选择 NPO 而非 CPO:规避 CPO 的可靠性、可制造性、可维护性难题,并延续现有光模块产业生态——这是工程务实主义的典型选择。OIO 则更激进,目标是把光 IO 直接做进 GPU 封装,与 HBM、die 一起共封装,被视为超节点互连的远期方向。

华为 Hi-ONE 案例精算:5500 引擎 vs 4.8 万模块​

昇腾 960 超节点的 NPO 方案给出一组可以精算的对比:

指标传统可插拔方案昇腾 960 NPO 方案
光互连器件~48000 颗 800G 光模块5500 个 Hi-ONE 光引擎
单器件容量800G7.2T(单引擎)
功耗基线降低超 550 kW
无故障运行时间基线提升一倍
整体可用度—99.8%

三个要点值得展开:

  1. 单引擎容量 7.2T:一颗 Hi-ONE 顶 9 颗 800G 模块,器件数量骤降一个数量级,故障点随之大幅减少——这是无故障运行时间翻倍的直接来源;
  2. 省 550kW 意味着什么:550kW 约等于把整个 Vera Rubin NVL72 机柜(约 180kW TDP)的耗电省出近三台,省下的不仅是电费,更是散热系统的建设成本;
  3. 唯一内置光源:Hi-ONE 是业界首个量产、当前传输能力最大且唯一内置光源的 NPO 产品,内置光源意味着激光器与引擎协同设计,省去外置光源的耦合损耗。

配合灵衢 UnifiedBus 全域 D2D 互连(RTT 2μs),这套光互连底座支撑起单节点 4096 卡、8 EFLOPS FP8、1PB HBM 的超节点规模。

光互连对超节点规模的意义:72 卡到 4096 卡的物理前提​

超节点的本质是让大量卡共享统一内存编址、像一台机器一样工作,而互连带宽与时延是规模的第一性约束。华为仿真数据:4K 超节点组成的 10 万卡集群,相比传统 8 卡服务器组网,MFU 提升 2.75 倍——因为在传统架构下,集群内通信占用训练时间超过 40%。

从 72 卡(NVL72 级别)到 4096 卡(昇腾 960 超节点),跨了两个数量级,物理上只有光互连能同时满足带宽密度、传输距离和功耗预算。NPO 把光链路推进到基板级,使跨机柜、跨机行的卡间通信时延降到微秒级,"逻辑上的一台机器"才有了物理载体。再往上,多个 960 超节点经灵衢网络或 RoCE 互联,最大可扩展到 51.2 万卡乃至 100 万卡集群——光互连是这一切的物理前提。

硅光、VCSEL、EML:技术路线与投资热​

光互连的爆发也点燃了产业链与资本市场:

  • EML 激光器:相干与高速光模块的核心光源,分析师口径显示 Lumentum 持有约 60% 的 EML 市场份额,是本轮"光进铜退"最直接的受益者之一;
  • 硅光集成:把调制器、波导、探测器集成在硅片上,与 CMOS 工艺兼容,是 CPO/OIO 时代的主力路线;
  • VCSEL 路线:Volantis 用类似 Face ID 的垂直腔面发射激光器连接 AI 芯片与内存芯片,主打短距、低成本,斩获 8800 万美元 A 轮融资;
  • 加速器光互连创业潮:CScale 开发面向加速器的光互连技术,C 轮融资 1.45 亿美元;Upscale AI 推出多厂商芯片互联的 Token Fabric 平台,获 NVIDIA 参投(2026-10-08)。

从激光器材料、硅光工艺到系统级创业公司,资本正沿光互连链条全面下注——这与当年 HBM 军备竞赛的剧本如出一辙。

小结​

光互连不再是数据中心的"锦上添花",而是超节点规模的"生死线"。可插拔光模块在 4.8 万颗的量级上暴露了功耗天花板,NPO 用 5500 个光引擎交出了省电 550kW、可用度 99.8% 的量产答卷,CPO 与 OIO 则代表着更彻底的光电融合。当卡间通信成为训练时间的大头,"光进铜退"就不再是技术偏好,而是算力扩张的唯一出路。

一颗 GPU 背后的七颗芯片:NVIDIA "七芯片堆栈"战略全拆解

· 阅读需 7 分钟
Industry Research Team

当竞争对手还在对比单颗 GPU 的 FLOPS 时,NVIDIA 已经把战场挪到了另一个维度。2026 年 GTC 发布的 Vera Rubin 平台,表面上是"新一代 GPU",实际上是一套由七颗芯片组成的完整 AI 工厂蓝图。据站内芯片数据库,这七颗芯片分别是:Vera CPU、Rubin GPU、NVLink 6 交换机、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 以太网交换机,以及 Groq 3 LPX。本文逐一拆解这套"七芯片堆栈"的分工、协同与战略意图。

七颗芯片,各司其职​

先看全局分工表(数据据站内芯片数据库):

#芯片角色关键规格
①Vera CPU主机调度中枢88 核自研 Olympus、1.5TB LPDDR5X、1.2TB/s
②Rubin GPU训练与 prefill 主力288GB HBM4、22TB/s 带宽、50 PFLOPS FP4
③NVLink 6 交换机纵向扩展互联单 GPU 3.6TB/s、NVL72 机柜 260TB/s
④ConnectX-9 SuperNIC横向扩展网络单端口 1.6T、延迟低于 0.5μs、GPUDirect
⑤BlueField-4 DPU基础设施卸载与存储驱动第三层推理上下文内存存储平台,token 吞吐最高 5 倍
⑥Spectrum-6 交换机数据中心以太网骨干Scale-out 网络核心
⑦Groq 3 LPX智能体解码加速256 颗 LPU/机架、128GB 聚合 SRAM、40 PB/s

七颗芯片覆盖了 AI 工厂从计算、互联、网络到存储的每一层——这是一个信号:NVIDIA 卖的不再是芯片,而是一整座工厂的参考设计。

计算层:Vera + Rubin + LPX 的异构三重奏​

计算层的分工体现了"每 token 经济学"的推理:

Rubin GPU 负责训练与 prefill。3360 亿晶体管、22TB/s 显存带宽,让它成为吞掉训练算力与推理 prefill(吃算力)这两个负载的最优解。

Groq 3 LPX 专攻智能体 decode。据站内芯片数据库,LPX 机架集成 256 颗 LPU,聚合 128GB 片上 SRAM 提供高达 40 PB/s 的片上带宽,互联达 640 TB/s。decode 阶段的核心瓶颈是内存带宽而非算力,LPU 用超大片上 SRAM 绕开这一瓶颈,延迟达到纳秒级——对于每秒上千次调用的 agentic AI 负载,这是 GPU 结构上难以企及的能力。GPU 管 prefill、LPU 管 decode,两种架构各干各的,总成本反而更低。

Vera CPU 是调度中枢。88 个自研 Olympus 核心、第二代 SCF 一致性结构(3.4TB/s 对分带宽)、1.5TB LPDDR5X 与 HBM4 构成单一一致性内存池,负责数据搬运调度、内存管理与系统控制编排——海量的智能体沙盒、KV 缓存卸载、多模型并发,都由它承接。

AI 工厂的网络是分层的,NVIDIA 用三颗芯片精确对应:

  • NVLink 6 交换机(Scale-up):机柜内纵向扩展,单 GPU 3.6TB/s 全互联带宽,让 72 乃至更多 GPU 像一颗 GPU 一样工作。这是训练超大模型的命脉,也是 NVIDIA 最深的护城河;
  • ConnectX-9 SuperNIC(Scale-out):单端口 1.6 Tb/s 的跨机柜网络,延迟低于 0.5 微秒,支持 GPU-NIC 直接 DMA,决定集群的横向扩展效率;
  • Spectrum-6 以太网交换机:承载南北向流量与存储网络,是数据中心以太网骨干。

三级网络的本质是把"AI 工厂"拆解成可量化的工程指标:token 从进入机房到输出,要经过计算、Scale-up、Scale-out、存储四类路径,NVIDIA 在每一条路径上都放了一颗自己设计的芯片。

BlueField-4:被忽视的第三层存储革命​

七芯片堆栈中最容易被低估的是 BlueField-4 DPU。它的战略意义在于驱动第三层推理上下文内存存储平台——在 GPU 显存(HBM)与主机内存(LPDDR5X)之外,用 DPU 管理一层专门的推理上下文存储,官方宣称可将 token 吞吐提升最高 5 倍。

这重构了经典的 HBM-DRAM-NAND 三层存储金字塔:智能体对话的 KV 缓存、多轮会话上下文,不再挤占宝贵的 HBM4 容量,而是按热度分层放置在三级存储中。对于长上下文、多轮对话的 agentic AI 负载,这一层的存在直接决定了"每 GB 有效 KV 容量成本"——一个纯 GPU 厂商根本无法优化的指标。

七芯片堆栈的封锁性引发过大客户反弹,NVIDIA 的回应是有选择的开放:

  • NVLink Fusion:向合作伙伴开放 NVLink 互联,允许其将自定义 CPU 或加速器集成进 NVIDIA 的 Scale-up 域——用互联标准换取生态驻留;
  • NVHBM 定制内存控制器计划:允许超大规模客户定制 HBM 配置,市场传闻亚马逊 Annapurna 团队正参与合作——把客户自研芯片的冲动,引导为"在 NVIDIA 平台上定制"的合作姿态。

这步棋颇为高明:客户想自研的动机无非是定制与议价,NVIDIA 干脆把定制能力开放出来,但互联与软件栈的根仍握在自己手里。

系统级竞争:对手的对位打法​

Bain 在 2026 年的行业分析给出了一个重要判断:AI 算力的竞争优势正从芯片规格转向系统级整合。这解释了为什么各大厂商都在拼"整栈":

厂商CPUGPU/加速器互联/网络开放程度
NVIDIAVera(自研)Rubin R200NVLink 6 + ConnectX-9 + Spectrum-6NVLink Fusion 有限开放
AMDEPYC VeniceMI455X/MI500Vulcano NIC + UALink开放标准联盟
华为自研鲲鹏系昇腾系列灵衢 UnifiedBus国内生态自主

AMD Helios 机架的组合是 EPYC Venice(256 核 Zen 6)+ MI455X + Vulcano 网络芯片,以 UALink 开放标准对抗 NVLink 的封闭性——用"开放"换生态盟友。华为的灵衢 UnifiedBus 则在国内市场构建对位体系。但双方都面临同一个难题:NVIDIA 的七芯片是同步迭代的——Vera 与 Rubin 同代设计、NVLink 6 为 HBM4 的带宽特性量身定做、LPX 与 GPU 的 prefill/decode 分工在参考架构层面打通。对手的"拼装式整栈"在迭代节奏上天然慢一拍。

小结​

七芯片堆栈是 NVIDIA 对"AI 工厂"时代的一次完整应答:计算层用 Vera、Rubin、LPX 实现异构分工,互联层用 NVLink 6、ConnectX-9、Spectrum-6 铺设三级网络,BlueField-4 则重构了推理存储的金字塔。再辅以 NVLink Fusion 的有限开放与 NVHBM 定制计划,NVIDIA 把竞争维度从"单芯片规格"彻底抬升到"系统级整合"——Bain 的判断在这里得到了最好的注脚。对买方而言,评估下一笔 AI 基础设施投资时,问题已经不该是"这颗 GPU 多少 TFLOPS",而是"这套系统能把每 token 成本压到多少"。谁能回答好后者,谁就赢得下一个五年。