Skip to main content

昇腾950 双轨战略:950PR 主攻推理 Prefill、950DT 押注训练超节点

· 6 min read
Industry Research Team

当算力供给的矛盾从"有没有"转向"够不够",芯片设计的刀法也开始向场景细分。华为昇腾950系列首次拆分为950PR与950DT双版本——前者专攻推理Prefill,后者押注Decode与训练超节点。这既是Prefill/Decode负载特性差异的工程回应,也是自研HBM产能约束下的现实选择。

一、为什么推理要拆成两颗芯片​

大模型推理的两条流水线,瓶颈完全不同:

  • Prefill(首 Token 生成):一次性吞下整段 Prompt 做并行计算,算力(FLOPS)是瓶颈,带宽需求适中;
  • Decode(逐 Token 生成):每生成一个 Token 都要把权重和 KV Cache 从显存搬一遍,带宽是瓶颈。

把两类负载塞进同一颗芯片,必然出现"一半硅片在空转"的错配。华为的解法是同一 Da Vinci v5 计算核心、两套内存子系统——950PR 用成本优先的 HiBL 1.0,950DT 用带宽优先的 HiZQ 2.0。这与 Google 的思路殊途同归:谷歌同样在 TPU 家族中把训练型 8t 与推理型 8i 拆分为两条产品线,让"算力密集"和"带宽密集"各自归位。

维度昇腾 950PR昇腾 950DT
目标场景推理 Prefill(首 Token 生成)、视频推荐、实时交互推理 Decode + 模型训练
HBM自研 HiBL 1.0,128 GB自研 HiZQ 2.0,144 GB
HBM 带宽1.6 TB/s4 TB/s
FP8 算力1 PFLOPS(HiF8 格式)1 PFLOPS(HiF8 格式)
FP4 算力2 PFLOPS2 PFLOPS
TDP~400 W~500 W
定价逻辑成本优先带宽优先、性能优先

按《昇腾 950 NPU 架构白皮书》的精确口径,FP8 算力随配置在 919–1034 TFLOPS 之间(宣传口径取整 1 PFLOPS),FP4 为 1561–2007 TFLOPS。两者共享同一计算核心,差异全部体现在内存子系统上——950DT 的 4 TB/s 带宽正是 Decode 与训练场景的命门。

二、Da Vinci v5:双编程模型与 HiF8 的精度革命​

昇腾950 是 Da Vinci 架构第五代,两项变化值得单独展开:

SIMD + SIMT 双编程模型。SIMD 延续 Da Vinci 在向量计算上的传统优势;新增的 SIMT 模型则面向 Decode 阶段大量不规则内存访问,让开发者可以用更接近 GPGPU 的方式写算子。配合内存访问粒度从 512 字节压缩到 128 字节,离散内存访问效率提升 4 倍——这对小 batch、多并发的推理业务是实打实的收益。华为同时提供 ASIC(昇腾 Core)与 GPGPU 双生子型号,兼容两种开发范式。

HiF8 自研 FP8 格式。低精度化的最大阻力是精度损失,HiF8 的设计目标是"精度接近 FP16、算力比 FP16 提升 2 倍",配合 FP4 格式整体算力利用率提升 30% 以上。结合 2 TB/s 灵衢互联,384 颗 950 组成的 CloudMatrix 384 超节点总算力约 384 PFLOPS FP8,以系统级规模对冲单卡代差。

三、自研 HBM:供应链意义大于纸面参数​

950 系列首次搭载华为自研 HBM——950PR 用 HiBL 1.0(成本优先),950DT 用 HiZQ 2.0(带宽优先,4 TB/s 对标 NVIDIA HBM3e)。这组数字的意义不在跑分,而在供应链:过去国产 AI 芯片的产量天花板被 SK 海力士、三星的 HBM 配额捏在手里,自研 HBM 让昇腾第一次把"产能多少"的决定权拿回自己这边。

但产能爬坡需要时间。渠道数据显示,国产 HBM 产能目前仅能支撑约 25–30 万颗成品加速器,缺口约六成——这正是下文涨价潮的底层原因。

四、徐直军 HC2026 访谈:节奏、份额与产能​

2026 年 10 月 8 日,华为副董事长徐直军在 HC2026 期间接受访谈,披露了几个关键信息:

  • 950PR 已于 2026 年第一季度发布上市,定位推理场景,"上市量不算大";
  • 950DT 超节点正在测试中,规模供货预计今年年底或明年初落地;
  • 关于训练业务,徐直军表示:"950DT 训练表现非常不错,明年开始大量模型训练会构筑在 950DT 超节点上;关键在供货能力,能产多少供多少。"
  • 从华为统计口径看,昇腾在中国市场的份额已超过英伟达;
  • 华为暂无全面海外拓展计划,重心仍在国内市场。

"能产多少供多少"这六个字,基本概括了当前国产 AI 芯片的真实处境:需求端远未见顶,第一约束已经从市场转移到了产能。

五、生态与价格:开源换时间,稀缺换定价​

生态侧,昇腾950 正在以"开源 + 头部共建"提速:DeepSeek 与华为联合开源面向昇腾950 的编程工具链(含计算与通信库),头部模型厂商直接参与共建是"去 NVIDIA 化"的标志性事件;CANN 已全面开源,外部开发者占比达 61%(首次超过内部团队),月活开发者突破 5200 人,PyTorch 官网将昇腾列为首个中国算力平台;昇腾950 智算集群云服务已于 9 月 30 日在国内商用。

价格侧则是另一番景象。受 HBM 成本攀升与供不应求驱动:

型号年初报价2026-10 市场报价涨幅
昇腾 950PR~¥6 万突破 ¥8 万+30%
昇腾 950DT~¥12–15 万指示性报价超 ¥25 万两个月内最高 +50%

950DT 的渠道指示价已经对齐 NVIDIA B200 的量级——国产旗舰的定价逻辑,正从"替代品折价"转向"供给稀缺溢价"。

小结​

昇腾950 的双轨战略回答了两个问题:产品层面,Prefill/Decode 分芯片让每一份硅片和带宽都花在刀刃上,与 Google TPU 的产品线拆分形成跨洋呼应;供应链层面,自研 HBM 把产能主动权握回手中,但爬坡期的缺口也直接推高了价格。徐直军"能产多少供多少"的表述说明,2027 年国产算力的故事主线不再是需求,而是产能——950DT 超节点能否如期规模供货,将决定明年大量模型训练是否真正构筑在国产超节点之上。