跳到主要内容

昇腾960 超节点:全球首个 NPO 超节点的 4096 卡野心

· 阅读需 6 分钟
Industry Research Team

2026 年 9 月 17 日,华为全联接大会(HC2026)上海站,华为轮值董事长汪涛官宣昇腾960 超节点——全球首个采用 NPO(近封装光学)技术的超节点。4096 卡、8 EFLOPS FP8、1PB HBM,加上提前三个季度就绪的 960DT,华为把"系统级算力"的赌注又加大了一档。

一、HC2026 发布:单节点 4096 卡意味着什么​

先看官方口径的核心数字:

指标昇腾 950 超节点昇腾 960 超节点
单节点卡数1024 卡(WAIC 2026 展出)4096 卡
FP8 算力8 EFLOPS(8192 卡满配)8 EFLOPS(单节点)
FP4 算力16 EFLOPS(8192 卡满配)16 EFLOPS(单节点)
HBM 总容量1152 TB(8192 卡满配)1 PB(4096 卡)
互联 RTT3 μs2 μs(全域 D2D)
光互联灵衢 2.0 总线NPO 光引擎 Hi-ONE

一个直观的对比:950 超节点需要 8192 卡满配才能达到的 8 EFLOPS FP8,960 超节点在单节点 4096 卡内即已实现——这背后是单卡规格翻倍与光互联密度提升的叠加。芯片侧,昇腾960DT 升级至 Da Vinci v6 架构:FP8 2 PFLOPS、FP4 4 PFLOPS、288GB 自研 HBM、9.6 TB/s 带宽,各项指标较 950 系列全部翻倍,华为称这一路径为"韬定律"。双版本节奏同样清晰:960DT 配风冷超节点 Atlas 860,960PR 配液冷超节点 Atlas 960,分别于 2027 年 Q2、Q3 上市。

二、NPO 光互连:一场功耗与密度的革命​

超节点规模越大,互联越是命门。传统可插拔光模块的功耗与密度,正是把超节点从"千卡"推向"万卡"的最大障碍。昇腾960 超节点的答案是 NPO(Near-Package Optics,近封装光学):

  • 5500 个 Hi-ONE 光引擎替代 48000 颗 800G 光模块,单引擎传输容量 7.2T,是业界首个量产、当前传输能力最大、唯一内置光源的 NPO 产品;
  • 系统功耗降低超 550 kW——相当于省出一个中型数据机房的总功率;
  • 无故障运行时间提升一倍,整体可用度达 99.8%。

华为选择 NPO 而非更激进的 CPO,理由是工程务实:NPO 在保留光引擎独立性的同时实现光电近距离握手,规避了 CPO 在可靠性、可制造性、可维护性上的难题,并延续现有光模块产业生态。

对照海外路线,这条路径的差异非常明显:NVIDIA 的 NVL72 系列在机柜内坚持铜互连(NVLink 铜背板),AMD 亦以铜互连为主、借助 UALink 开放生态扩展机柜间网络。铜互连在 72–144 卡尺度上功耗与成本占优,但要再往上走一个数量级,光进铜退几乎是必然。昇腾960 用 NPO 直接把光互联压进超节点内部,是在用互联架构换规模上限——这也是 4096 卡得以成立的前提。华为马尔科夫实验室的仿真给出了一组佐证:4K 超节点组成的 10 万卡集群,相比 8 卡服务器组网,MFU 提升达 2.75 倍——传统架构下,集群内通信要吃掉超过 40% 的训练时间。

三、4096 卡 vs NVL72:两种规模哲学​

把昇腾960 超节点与 NVIDIA NVL72 放在一起,看到的不是同一张设计图的两个版本,而是两种哲学:

维度NVIDIA NVL72昇腾960 超节点
单节点规模72 卡4096 卡
互联介质铜背板(NVLink)NPO 光引擎(Hi-ONE)
设计逻辑小域高带宽、机柜间以太网扩展大域统一内存、集群级扩展

NVL72 的思路是把最紧密的互联限制在 72 卡的小域内,用成熟的铜互连控制功耗,再靠网络横向扩展;昇腾960 则把"超节点"的边界直接推到 4096 卡,用统一内存编址和 2 μs 全域 RTT 让整个节点在逻辑上"像一台机器"。单卡绝对性能仍落后 NVIDIA 旗舰一代的背景下,华为选择用更大的 Scale-Up 域弥补代差——评估国产算力,不能只比单芯片 PFLOPS。

四、提前三个季度:执行信号与一年一代路线图​

比规格更值得注意的是节奏:昇腾960DT 较原计划提前三个季度就绪,960PR 提前一个季度。在先进制程受限的环境里,提前就绪意味着供应链、封装、整机调测的每一个环节都被压缩过——这是执行力的信号,也是对客户交付承诺的背书。

路线图同步浮出水面:2028 年昇腾970、2029 年昇腾980,"一年一代"的迭代节奏与算力规格持续翻倍的韬定律并列官宣。而 960 的部署底盘已经就位——昇腾910C 超节点已部署超 1000 套,950 超节点规模商用,CANN 外部开发者占比升至 61%、月活开发者突破 5200 人。

配套系统同步升级:鲲鹏 TaiShan 950 超节点支持全光组网下 4096 节点、256TB 统一内存池;OceanStor M900 上下文内存存储基于灵衢总线一跳直连 PB 级 KV Cache,把推理时代的上下文瓶颈纳入系统级解法。集群扩展路径上,多个 960 超节点经灵衢网络或 RoCE 互联可达 51.2 万卡,叠加多轨道拓扑后支持 100 万卡集群。

小结​

昇腾960 超节点的故事有三层:工程层面,NPO 光互连用 5500 个光引擎换下 4.8 万颗光模块、省电 550 kW,把光互联提前压进超节点内部,走出了与 NVIDIA 铜互连不同的路线;架构层面,4096 卡对 72 卡,是以更大的 Scale-Up 域对冲单卡代差的规模哲学;执行层面,960DT 提前三个季度就绪,让"一年一代"从路线图变成了可以兑现的承诺。2027 年 Q2 上市在即,真正的考验将是:这 4096 卡的野心,能否按期变成机房里实际运转的算力。