跳到主要内容
Industry Research Team
查看所有作者

华为昇腾950系列产能与订单深度:950PR月产能跳升10倍,字节56亿美元锁定35万片

· 阅读需 5 分钟
Industry Research Team

昇腾 950 系列(950PR 推理 / 950DT 训练)已成为国产 AI 算力的核心供给。据多家券商与行业调研,950 系列产能已 100% 排满、现货稀缺,全年 120 万片目标"确定性 100%",并存在上调至 150 万片的预期。本文汇总截至 2026 年 7 月的产能与订单数据。

1. 产能节奏:6月环比近10倍跳升​

时间950PR 月产能备注
2026年5月5–6 万片基本满产
2026年6月50–60 万片环比接近 10 倍;中芯、华虹一供全线加班
2026年 Q3(预计)70–80 万片单月
2026 全年目标120 万片有上调至 150 万片预期

产业链交付吃紧:高速背板、液冷连接器交货周期从 2 周拉长至 6–8 周,订单已排至 2027 年。

2. 订单结构:头部云厂 + 运营商 + 海外​

客户锁定量金额 / 备注
字节跳动35 万片 950PR56 亿美元,2026 Q3 起集中交付
腾讯 / 阿里 / 百度约 25 万片 950PR + 15 万片 950DT合计约 40 万片
三大运营商超 20 万片集采,用于智算中心与 AI 专网
海外韩国 2,000 片、马来西亚 3,000 台服务器、俄罗斯万卡级集群从试点转向商用

3. 出货预测:稳居国产第一​

据科智咨询测算:

指标20252026(预测)
华为昇腾总出货量81.2 万张102.6 万张
其中 950PR—约 80 万片
其中 950DT—约 10–20 万片

华为已完成由 910 系列向 950 系列的产品切换。互联网行业已成为昇腾最大应用市场,竞争优势正由单一硬件性能延伸至软件生态与系统能力。

4. 出海:Q4 正式入韩​

据韩媒 ETNews 报道,华为计划 2026 Q4 以昇腾系列及 Atlas 950 SuperPod 正式进入韩国市场:

  • 已完成本土分销商协议,选定 SK Shieldus 等两家渠道伙伴;
  • 主力产品为 950PR(4 月已量产交付) 与 950DT(Q4 同步推出);
  • 官方口径:950PR 推理性能达 H20 的 2.87 倍,定价约为其 1/4。

5. WAIC 2026:1024 卡真机首秀确认​

WAIC 2026(7月17–20日上海)上,华为 Atlas 950 SuperPoD 真机首次公开亮相,现场展出 16 台计算柜、1024 张昇腾卡 规模,并斩获大会最高荣誉 SAIL 大奖:

  • 核心指标:总算力 1 EFLOPS FP8 / 2 EFLOPS FP4,256 TB 全局统一内存编址,灵衢 2.0 互联、3 μs 超低 RTT 时延;
  • 满配形态:128 计算柜 + 32 互联柜 = 160 机柜、占地约 1000 ㎡,搭载 8192 颗昇腾 950DT,计划 2026 年 Q4 上市;
  • 商用基础:上一代 384 超节点已累计商用超 750 套,落地 20+ 行业;
  • 软件生态:CANN 已于 2025 年底全面开源,社区孵化 67 个项目、超 1244 万行代码,月活开发者超 3500 人。

WAIC 首秀确认了 950 系列"超节点优先"的产品逻辑:单卡算力之外,系统级有效算力(互联带宽 + 统一内存 + 低时延)才是国产算力对标国际旗舰的关键维度。

昇腾路线图回顾​

产品定位关键指标(官方路线图)
950PR推理1 PFLOPS(FP8)/ 2 PFLOPS(FP4),互联 2 TB/s
950DT训练超节点核心,Q4 推出
960训练/推理2 PFLOPS(FP8)/ 4 PFLOPS
970下一代规划中

产业解读​

  1. 国产替代从推理迈向训练:950PR(推理)率先放量,950DT(训练)Q4 跟进,配合 Atlas 950 SuperPoD 万卡互联,国产算力首次具备"训练替代"完整拼图。
  2. 产能是最大变量:订单确定性极高,但中芯/华虹先进制程产能、HBM 供应、先进封装仍是放量瓶颈——这也是"现货稀缺"的根源。
  3. 出海打开第二曲线:韩国、马来西亚、俄罗斯、拉美的批量采购,标志国产算力从"内循环"走向"外循环"。

相关链接​

参考资料​


本文数据以官方与主流券商调研为准,产能/订单为动态数字,将持续更新。

NVIDIA Vera Rubin正式出货:首台VR200 NVL72交付,三星HBM4量产,Rubin Ultra机柜天价

· 阅读需 5 分钟
Industry Research Team

2026年7月,NVIDIA 下一代 AI 计算平台 Vera Rubin 正式启动首批出货,接替 Blackwell 架构,并计划在 2026 年下半年进入大规模量产。首批客户包括微软、谷歌、亚马逊、Meta、Oracle 等大型云服务商。

1. 全球首台 VR200 NVL72 交付(里程碑)​

CoreWeave 联合 Dell 宣布,全球首台 NVIDIA Vera Rubin VR200 NVL72 机柜已正式交付,并一次性通过 L11 全机柜级硬件诊断测试。这标志着 Rubin 从路线图走向实物,供应链核心环节(HBM4、先进封装、液冷、超高功率电源)未出现重大卡点。

VR200 NVL72 核心配置​

指标Vera Rubin VR200 NVL72
机柜代号Oberon
GPU72 块 Rubin GPU
CPU36 颗 Vera CPU
单 GPU 显存288 GB HBM4
单 CPU 内存1.5 TB LPDDR5X
整柜 HBM420.7 TB(20,736 GB)
整柜 LPDDR5X54 TB
互联NVLink 6 全互联
推理性能~3.6 exaFLOPS 级别
散热液冷
代际提升单 GPU 计算约 3.5×、内存带宽约 2.8×(对比 Blackwell)

Vera CPU 集成 88 个定制 Olympus ARM 核心,与 GPU 间互联带宽 1.8 TB/s,可作为 GPU 显存扩展池。NVIDIA 已于 5 月完成对 Anthropic、OpenAI、xAI 及 Oracle Cloud 的首批 Vera CPU 交付。

2. 三星 HBM4 量产:关键瓶颈松动​

2026年7月8日,三星电子正式启动面向 Vera Rubin 平台的 HBM4 量产,据报道其 HBM4 量产良率达到 70%(超出 60–65% 的初始预期)。这一关键供应链环节的确认,为 Rubin 大规模部署扫清障碍。

HBM 供应格局(2026 Q1)份额
SK 海力士45%
三星40%
美光15%

HBM4 采用 8 层堆叠(12 层设计计划 2028 年),价格约为 HBM3e 的 2.8 倍。TrendForce 预测 HBM 供给将年增 65%,到 2027 Q4 HBM4 占总产出的 35%。

3. Rubin Ultra 天价:HBM 成本主导​

据美国银行全球研究(BofA Global Research)测算,Rubin 一代将把单台服务器成本推向历史新高:

成本项Rubin VR200(Oberon)对比
单柜 HBM4 用量20,736 GB—
HBM4 单价~$18.40 / GBBlackwell(HBM3e)~$11.26 / GB
仅 HBM4 成本~$38.2 万尚未计入 LPDDR5X
Rubin Ultra 机柜预估售价~$2,100 万IT 之家 / BofA 估算

4. Rubin Ultra 设计调整:原 4 芯片方案取消(据 SemiAnalysis)​

半导体研究机构 SemiAnalysis(2026-06-30) 披露,GTC 2026 发布的原版 4 芯片 Rubin Ultra GPU 已被取消,2027 年实际出货的版本规模与性能均缩减约一半:

  • 取消原因:原版在单一 CoWoS-L 封装内集成 4 颗计算 die + 16 颗 HBM4E,基板在 4 die 配置下出现翘曲(warpage),导致计算 die 与基板接触失效、良率崩塌;替代方案 CoPoS 量产要等到 2028 年底以后,赶不上 2027 节点。
  • 新方案:改为 双 die(与标准 Rubin 同构)+ HBM4E,单 GPU 约 384 GB HBM4E(高于标准 Rubin 的 288 GB),但总算力与带宽仅为原版一半;为逼近原设计的聚合算力,NVIDIA 预计在 Kyber 机架内以"2+2"板级配置 拼出四 die 等效规模。
  • Kyber 机架延迟:配套 Kyber NVL144 机架因中板 PCB 制造难题推迟 12 个月以上至 2028 年,800V 直流供电方案同样推迟至 2028 年。

⚠️ 口径提示:NVIDIA 未就上述设计调整发表官方评论;X 平台亦有声音认为"芯片数量并未改变、属旧闻翻炒"。本段基于 SemiAnalysis 公开报告整理,最终以 NVIDIA 官方披露为准。我们已在 Rubin Ultra 预览卡 中标注"规格待官方确认"。

产业解读​

  1. "Never doubt"时刻兑现:Rubin 首发交付一次性通过 L11,打消了市场对"Rubin 延期"的疑虑,2026 H2 AI 算力供应确定性提前锁定。
  2. 专为 Agentic AI 设计:Rubin 面向智能体工作流、超长上下文推理,将进一步压低万亿参数模型的训练/推理成本曲线。
  3. HBM 是全链条赢家:单机柜 20.7 TB HBM4 用量巨大,SK 海力士、三星、美光及先进封装(CoWoS-L)、液冷、电力改造全链条受益,同时也成为成本与产能的最大约束。

相关链接​

参考资料​


本文持续跟踪 Vera Rubin 量产爬坡与 HBM4 供应链动态。

2026年H1 AI芯片行业复盘:Blackwell Ultra、国产三强与推理新时代

· 阅读需 12 分钟
Industry Research Team

2026年上半年,AI芯片产业发生了历史性转折——产业重心从"训练竞赛"转向"推理效率",国产芯片市场份额首次突破40%,NVIDIA以Blackwell Ultra筑高壁垒,推理专用芯片赛道百花齐放。


一、算力再翻番:NVIDIA Blackwell Ultra 发布(6月1日)​

2026年6月1日,NVIDIA CEO黄仁勋在**台北国际电脑展(Computex 2026)**上揭晓新一代AI芯片 Blackwell Ultra,为未来两年的AI基础设施竞赛划定新起跑线。

关键规格​

指标Blackwell UltraB200提升
FP8算力20 petaFLOPS~10 petaFLOPS100%
架构Blackwell UltraBlackwell升级
预计交付2027年Q12026年Q1—
定位超大规模训练+推理训练+推理旗舰

产业意义​

  1. 算力翻倍的直接影响:20 petaFLOPS FP8意味着千亿参数模型训练时间大幅缩短,万亿参数模型训练从"科学实验"走向"工程常态"
  2. 系统级平衡:Blackwell Ultra不仅是芯片,更是NVLink、HBM、散热、供电的系统级工程突破
  3. 路线图确定性:2027年Q1交付时间表,让云厂商和AI实验室可以提前18个月规划基础设施预算

挑战​

  • 能耗危机:性能翻倍伴随功耗大幅上升,数据中心供电和冷却设计面临极限挑战
  • 可及性问题:顶级算力优先供应顶级云厂商,中小开发者和研究机构如何通过云服务以合理成本触达算力
  • 软件栈适配:新硬件需要匹配的CUDA版本和框架支持,软件生态成熟度成为算力转化的关键瓶颈

二、国产AI芯片:从"可用"到"好用"的临界点​

2026年6月16日,信创世界发布**《2026中国国产AI芯片厂商能力象限》**,清晰勾勒出国产AI芯片的整体格局。

2.1 能力象限排名​

象限代表厂商
领导者象限华为昇腾、海光信息、寒武纪、阿里平头哥、摩尔线程
远见者象限百度昆仑芯、壁仞科技、燧原科技、沐曦股份、瀚博半导体
竞争者象限清微智能、黑芝麻智能、芯驰科技、砺算科技、后摩智能
挑战者象限登临科技、知存科技、芯原股份、瑞芯微、云天励飞

2.2 华为昇腾:国产算力的定海神针​

市场地位​

  • 2025年昇腾系列出货 81.2万张,占国产AI加速卡 49% 份额,稳居国产第一
  • 昇腾950PR单卡FP8算力达 1P(PetaFLOPS)、FP4算力达 2P
  • 推理性能约为NVIDIA H20的 2.87倍,定价仅 7.2-7.5万元,性价比优势显著

全栈优势​

华为"端管云芯"一体化战略是昇腾的核心壁垒:

  • 芯片设计:Da Vinci 3.0架构持续迭代
  • 操作系统:鸿蒙/欧拉OS深度优化
  • 网络通信:欧拉网络协议栈
  • 云服务:华为云ModelArts平台无缝集成

最新进展​

  • 2026年6月5日,深圳河套学院联合哈工大(深圳)、华为团队,依托昇腾910C集群完成 1.6万亿参数DeepSeek V4 Pro大模型全参数后训练
  • 这是国产AI芯片首次完成万亿参数级大模型训练,标志着"国产替代"从推理迈向训练

2.3 寒武纪:率先盈利的国产AI芯片标杆​

业绩爆发​

指标2025年全年2026年Q1同比增长
营收64.97亿元28.85亿元+453% / +160%
净利润20.59亿元(首次年度盈利)10.13亿元— / +185%

核心产品:思元590​

  • 在DeepSeek R1推理场景下,TPS可达 942,比H20高出约 50%
  • 与字节跳动多年联合优化,具备短期最强的云端推理部署能力
  • 2026年Q1营收28.85亿元中,思元590贡献超过70%

潜在风险​

在2026年第2号《安全可靠测评结果公告》中缺席,原因尚未明确,将对其国内政企市场表现产生影响。

2.4 清微智能:可重构芯片的"第三路线"​

技术路线​

清微智能采用与Groq LPU同源的可重构数据流架构,在GPU通用性与ASIC极致效率之间找到了平衡点。

指标清微智能 TX81传统GPU方案优势
推理成本基准+100%降低50%
能效比基准基准提升3倍
架构可重构数据流SIMT/SIMD更适合推理

落地进展​

  • 可重构芯片累计出货量已超 3000万颗
  • 在全国十余座千卡规模智算中心实现规模化落地
  • 已启动A股IPO辅导,有望成为"可重构芯片第一股"

三、推理芯片赛道:产业重心转移的核心信号​

2026年6月4日,TrendForce发布深度报告**《推理经济时代来临:AI芯片的规则正被重写》,指出AI产业的算力竞争重心正在从训练转向推理**。

3.1 为什么是现在?​

成本结构改变​

  • 训练是一次性成本:模型训练完成后,边际成本趋近于零
  • 推理是持续性成本:每一次API调用、每一个生成token,都代表算力消耗与毛利压力
  • 单位推理成本与能效表现将直接影响毛利率与规模扩张能力

模型精简技术成熟​

  • 1.58-bit量化技术与权重剪枝,使模型可在极低内存占用下维持推理准确度
  • MoE(混合专家)架构通过"部分唤醒"机制,每次推理仅激活少数专家子网络,大幅降低实际运算量
  • 精简模型的崛起,为硬式编码推理芯片提供了商业可行性

3.2 NVIDIA的百亿押注:收购Groq(2025年12月)​

2025年12月24日,NVIDIA以 200亿美元取得Groq的Inference技术授权与核心团队,这是NVIDIA历史上最大规模的并购/技术收购之一。

战略意图:

  1. 补全推理短板:NVIDIA GPU在训练领域无可撼动,但推理效率一直不是最强
  2. 对抗专用推理芯片:Cerebras、Taalas、SambaNova等初创公司正在蚕食推理市场
  3. 布局Agentic AI:Agentic AI需要极低延迟、极高吞吐的推理能力

3.3 Taalas HC1:硬式编码推理的概念验证​

2026年2月20日,加拿大AI芯片初创公司Taalas发布推理芯片 Taalas HC1,将Meta的开源AI模型Llama 3.1 8B直接刻印在芯片中。

关键指标​

指标Taalas HC1NVIDIA B200(throughput optimized)优势
推理速率16,960 tokens/s/user基准~4-5x
每百万tokens成本0.75 cents3.79 cents降低80%
功耗~250W~700W降低64%
制程TSMC N6TSMC 4nm更成熟
HBM❌ 不使用✅ HBM3e成本更低

技术原理​

Taalas HC1采用**存储内运算(Computing-in-Memory, CIM)**的激进实现:

  • 将模型权重直接固化于Mask ROM中(完全硬体定义)
  • 以片上SRAM处理动态资料(KV cache和LoRA微调权重)
  • 仅需修改2层光罩就能产出另一个AI模型的专用芯片,将一个AI模型转化为实体芯片仅需2个月

局限性​

  • 缺乏弹性:硬式编码无法应对快速迭代的模型更新
  • 生态壁垒:当前云端市场仍依赖通用平台,客户可能更偏好可随模型升级的弹性方案
  • NRE成本:一次性工程费用高,需要足够大规模的部署才能摊薄

3.4 Cerebras:晶圆级整合的上市之路​

2026年5月14日,Cerebras Systems正式在纳斯达克挂牌上市,成为首家上市的晶圆级AI芯片公司。

核心技术:Wafer-Scale Integration(WSI)​

  • WSE-3(第三代晶圆级引擎):整片12英寸晶圆做成单一芯片
  • 44GB片上SRAM:无需外部HBM,彻底消除内存带宽瓶颈
  • 21 PB/s带宽:片上通信带宽,是GPU的千倍级别
  • 与OpenAI合作:已签署逾200亿美元、规模750MW的三年算力合作协议

上市意义​

Cerebras的上市是推理专用芯片赛道成熟的标志:

  1. 资本市场开始为这类公司定价
  2. 证明"非GPU"技术路线具备商业可行性
  3. 为其他推理芯片初创公司(Groq、SambaNova、Taalas等)提供了估值参照

3.5 推理芯片格局:多元技术路线并存​

公司技术路线核心优势代表产品
Taalas硬式编码(Mask ROM)极致推理效率、低成本HC1
Cerebras晶圆级整合(WSI)超高带宽、大模型推理WSE-3
GroqSRAM-first架构确定性延迟、高吞吐LPU(已被NVIDIA收购)
d-Matrix数字存储内运算(DIMC)灵活性强于硬式编码Corsair
EtchedHard-wired Transformer所有Transformer模型适用Sohu
Axelera AI数字存储内运算(D-IMC)+ RISC-V高能效比Metis AIPU

TrendForce预测:

  • 通用GPU仍主导训练与多模型环境
  • 但在成熟、可预测场景中,通用GPU的利润空间将受到压缩
  • 产业格局从通用算力垄断,走向通用与专用并行的双轨结构

四、2026年H1国产AI芯片整体格局​

4.1 行业进入放量期​

指标2025年2026年Q1趋势
国产AI加速卡出货量165万张(占比41%)—持续上升
中国AI加速卡总出货量~400万张——
海光信息营收增速—翻倍增长↑
寒武纪营收增速—+160%↑
摩尔线程营收增速—翻倍增长↑

头部厂商集体进入业绩兑现通道,行业从"技术验证"迈向"规模商用"。

4.2 三大核心发展趋势​

趋势一:资本化浪潮重塑格局​

  • 2025年底至2026年初,摩尔线程、沐曦股份登陆科创板
  • 壁仞科技登陆港股
  • 燧原科技科创板IPO获受理
  • 昆仑芯、平头哥启动上市进程
  • 清微智能、瀚博半导体等推进IPO

资本化带来双重效应:

  • ✅ 正面:为研发和生态建设提供支撑
  • ⚠️ 负面:估值泡沫和业绩兑现压力

趋势二:产能成为最大制约变量​

国产AI芯片爆发式需求与有限先进制程产能的矛盾日益尖锐:

厂商先进制程产能需求实际获得
华为昇腾每月1.5万片(7nm级)优先保障
中芯国际总产能每月约2万片(7nm级)—
其他厂商合计约5000片/月极度紧张

能否拿到稳定晶圆产能直接决定厂商生死。寒武纪75.4%的营收占比存货,本质是对产能的锁定。

趋势三:竞争从"可用"转向"好用"​

早期竞争聚焦"能否跑通模型",当前升级为"运行效率、部署成本"的比拼:

竞争维度"可用"时代"好用"时代
硬件性能能否跑通模型运行效率、能效比
软件栈基本适配成熟度、框架广度
生态有无开发者社区活跃度
部署成本不敏感核心竞争要素

五、2026年H2展望​

5.1 即将到来的关键事件​

时间事件影响
2026年Q3NVIDIA Rubin架构详情公布下一代旗舰规格揭晓
2026年Q3华为昇腾950PR/950DT正式发布国产推理芯片新标杆
2026年Q4AMD MI350X规模化交付NVIDIA Blackwell竞品
2026年Q4寒武纪思元690发布(推测)新一代训练芯片
2027年Q1NVIDIA Blackwell Ultra交付算力新标杆落地

5.2 未来三年关键竞争要素​

  1. 晶圆产能获取能力:先进制程产能是稀缺资源,绑定中芯国际、TSMC的厂商具备先天优势
  2. 资本运作效率:IPO窗口期有限,能否在资本市场上融到足够资金决定研发持续性
  3. 软件生态建设深度:硬件性能只是入场券,软件栈成熟度、框架适配广度、开发者社区活跃度才是核心壁垒

六、结语:多元生态终将形成​

2026年H1,AI芯片产业正在经历从"一家独大"到"多元并存"的历史性转变。

  • NVIDIA以Blackwell Ultra筑高训练壁垒,同时以收购Groq布局推理效率
  • 华为昇腾以全栈能力守住国产算力的基本盘,950PR在推理性能上开始超越H20
  • 寒武纪以率先盈利证明国产AI芯片的商业化可行性,思元590在特定场景超越国际竞品
  • Cerebras、Taalas等推理专用芯片公司开辟了"非GPU"的第三路线
  • 清微智能的可重构架构为中国AI芯片提供了技术路线的多元化选择

未来三年,国产AI芯片终局将形成GPU、ASIC、可重构计算三大技术路线并存,云端与边缘协同发展的多元生态。"国产替代"不再是口号,而是正在发生的产业现实。


数据来源:

  • 信创世界《2026中国国产AI芯片厂商能力象限》(2026-06-16)
  • TrendForce《推理经济时代来临:AI芯片的规则正被重写》(2026-06-04)
  • RayByte《算力再翻番!英伟达Blackwell Ultra芯片发布》(2026-06-02)
  • 各公司官方财报和公告

相关阅读:


2026年6月AI芯片重大事件汇总:昇腾910C训练万亿模型、OpenAI自研芯片、RTX Spark发布

· 阅读需 6 分钟
Industry Research Team

2026年6月,AI芯片领域迎来多个里程碑事件,标志着"国产替代"和"去英伟达化"两大趋势加速。

1. 华为昇腾910C完成1.6万亿参数DeepSeek V4 Pro训练(2026-06-05)​

事件概述​

2026年6月5日,深圳河套学院联合哈尔滨工业大学(深圳)、深圳市大数据研究院及华为等团队,依托昇腾910C国产AI算力集群,成功完成 1.6万亿参数DeepSeek V4 Pro大模型全参数后训练。

技术意义​

指标数值
模型参数1.6万亿
训练芯片昇腾910C集群
训练类型全参数后训练(Full Parameter Post-Training)
意义国产AI芯片首次完成万亿参数级大模型训练

产业影响​

  1. 打破技术封锁:证明国产AI芯片具备训练万亿参数大模型的能力
  2. "告别英伟达"加速:DeepSeek全面换装华为昇腾,减少了对H100的依赖
  3. 国产替代拐点:从"推理替代"迈向"训练替代"

相关链接​


2. OpenAI发布首款自研AI推理芯片Jalapeño(2026-06-24)​

事件概述​

2026年6月24日,OpenAI与博通(Broadcom)联合发布首款自研AI推理芯片 Jalapeño,设计周期仅9个月(行业平均18个月),采用TSMC 3nm工艺。

关键技术指标​

指标Jalapeño对比(Blackwell)
制程TSMC 3nmTSMC 4nm
架构Systolic Array(脉动阵列)Blackwell GPU
设计周期9个月~18个月
推理成本-50%基准
AI辅助设计✅ 首款❌ 否
部署时间2026年底已出货

战略意义​

  1. 首款AI辅助设计的AI芯片:OpenAI用GPT-5.3-Codex-Spark等模型辅助架构探索
  2. "去英伟达化"加速:科技巨头(谷歌、亚马逊、微软、Meta、OpenAI)集体自研芯片
  3. 推理成本革命:对于每天处理数亿次API调用的OpenAI,成本降低50%意义非凡

相关链接​


3. NVIDIA在Computex 2026发布RTX Spark AI PC超级芯片(2026-06-01)​

事件概述​

2026年6月1日,NVIDIA CEO黄仁勋在Computex 2026 / GTC Taipei发布 RTX Spark AI PC超级芯片,与联发科(MediaTek)合作,采用Arm CPU + Blackwell GPU统一内存架构。

关键技术指标​

指标RTX Spark
CPU最多20核Arm(联发科合作)
GPU6,144 CUDA核心(Blackwell)
统一内存128GB LPDDR5X(CPU+GPU共享)
内存带宽300 GB/s
AI算力~1 PFLOPS(推测)
模型容量可运行1,200亿参数模型
上下文最长100万tokens
TDP~100W(推测)
上市2026年秋季

产业影响​

  1. NVIDIA进军PC芯片市场:挑战英特尔在个人电脑领域的主导地位
  2. AI PC新标准:本地运行120B参数模型,100万token上下文
  3. Windows转变为AI Agent平台:与微软OpenShell框架深度合作

相关链接​


4. 工信部发布《2026年人工智能芯片产业发展白皮书》(2026-06-09)​

事件概述​

2026年6月9日,中国工业和信息化部发布《2026年人工智能芯片产业发展白皮书》,预测国内AI芯片市场规模将在2026年突破2000亿元人民币。

关键预测​

指标2026年预测
市场规模突破2000亿元人民币
国产芯片份额>50%(2025年为41%)
边缘推理芯片显著进展
出货量增长翻倍以上(相比2025年)

产业意义​

  1. 国产AI芯片资本化加速:寒武纪、燧原、摩尔线程等加速IPO
  2. 边缘推理成破局关键:相比训练芯片,推理芯片更易实现国产替代
  3. 政策红利持续:国产替代从"市场行为"升级为"国家战略"

5. 字节跳动洽谈采购天数智芯5万颗推理芯片(2026-06-17)​

事件概述​

2026年6月17日,路透社报道称,字节跳动正与上海AI芯片企业天数智芯洽谈采购至少5万颗AI芯片,主要用于推理任务。

交易细节​

项目内容
采购方字节跳动
供应商天数智芯
芯片型号智铠系列(推理GPU)
采购数量至少5万颗
用途推理工作负载
训练芯片天垓系列

产业意义​

  1. 国产GPU头部玩家"加人":天数智芯首次进入头部互联网公司供应链
  2. 字节跳动2026年资本开支上调超2000亿元:主要用于AI算力和数据中心
  3. "国产替代"从政府和国企扩展到民营科技巨头

总结:2026年6月AI芯片产业三大趋势​

趋势1:"国产替代"从推理迈向训练​

  • 昇腾910C完成1.6万亿参数模型训练 → 证明国产芯片具备训练能力
  • DeepSeek全面换装昇腾 → 头部AI公司率先"告别英伟达"
  • 字节跳动采购天数智芯 → 民营科技巨头跟进

趋势2:"去英伟达化"从口号变为行动​

  • OpenAI Jalapeño → 首款自研芯片,推理成本-50%
  • 谷歌TPU、亚马逊Trainium、微软Maia → 持续迭代
  • Meta MTIA、苹果M5 Ultra → 加大投入

趋势3:AI PC和边缘推理成为新战场​

  • NVIDIA RTX Spark → AI PC新标准,2026年秋季上市
  • 边缘推理芯片国产化加速 → 工信部白皮书重点提及
  • "万亿参数模型本地运行" → 消费者市场新卖点

展望未来(2026 H2)​

  1. 昇腾950DT全面放量(2026 Q4)→ 华为最新一代训练芯片
  2. NVIDIA Rubin R200出货(2026 H2)→ 下一代旗舰
  3. AMD MI400 Helios机架(2026 H2)→ 对标NVIDIA GB200
  4. OpenAI Jalapeño部署(2026年底)→ 千兆瓦级数据中心
  5. 国产AI芯片出货量翻倍以上 → 中信证券预测

参考资料​


本文持续更新,欢迎提供最新动态。

AMD MI455X CES 2026 震撼发布:4年AI芯片性能涨1000倍

· 阅读需 7 分钟
Industry Research Team

2026年1月5日,在CES 2026(国际消费电子展)首日,AMD董事会主席兼CEO苏姿丰博士在主题演讲中震撼发布:Instinct MI400系列AI加速卡。

其中最引人注目的是MI455X——AMD史上性能最强的AI加速卡,采用2nm + 3nm混合制程、432GB HBM4显存、FP4算力高达40 PFLOPS(FP8为20 PFLOPS)。

核心亮点​

  • MI455X:FP4算力40 PFLOPS,FP8算力20 PFLOPS,相比MI355X提升10×
  • MI450:高性价比版,FP4算力28 PFLOPS,288GB HBM4
  • 制程升级:全球首款采用2nm + 3nm混合制程的AI芯片(GCD用2nm,MCD用3nm)
  • 显存升级:从MI350X的288GB HBM3e升级到432GB HBM4(MI455X)
  • 带宽升级:从MI350X的8 TB/s升级到19.6 TB/s(提升2.45×)
  • 架构升级:从CDNA 4升级到CDNA 5
  • 量产时间:MI455X 2026年Q4,MI450 2026年Q3

MI400系列完整规格​

📌 重要更正(2026-06-16):经官方规格核对,MI455X 显存为 432GB HBM4(非早期报道的 288GB),FP4 算力为 40 PFLOPS。特此更正。

型号定位显存FP4 算力FP8 算力TDP(推测)
MI455X旗舰训练+推理432GB HBM440 PFLOPS20 PFLOPS~1,000W
MI450高性价比训练288GB HBM428 PFLOPS14 PFLOPS~800W
MI440X企业推理216GB HBM425 PFLOPS12.5 PFLOPS~600W
MI430XHPC / 科学计算192GB HBM420 PFLOPS10 PFLOPS~500W
MI400X通用 / 边缘推理128GB HBM412 PFLOPS6 PFLOPS~400W

关键升级(vs MI350系列):

  • 显存:HBM3e → HBM4,容量提升 50%(432GB vs 288GB)
  • 带宽:19.6 TB/s(vs MI350的 8 TB/s,提升 2.45×)
  • 算力:FP4 40 PFLOPS(vs MI355X的 20 PFLOPS,提升 2×)
  • 制程:2nm + 3nm 混合制程(GCD用2nm,MCD用3nm)
  • 架构:CDNA 5(vs MI350的 CDNA 4)

与MI355X的性能对比​

指标MI355X(2025)MI455X(2026)提升
FP4算力20 PFLOPS40 PFLOPS2×
FP8算力10 PFLOPS20 PFLOPS2×
显存容量288GB HBM3e432GB HBM41.5×
显存带宽8 TB/s19.6 TB/s2.45×
制程TSMC 3nm2nm + 3nm 混合新一代
架构CDNA 4CDNA 5新一代
TDP800-1000W~1,000W持平

苏姿丰在CES 2026上说:

"4年前,MI250的AI性能是X。现在,MI455X的性能提升了1000倍。这就是AI芯片的进步速度。"

CDNA 5架构详解​

MI400系列采用CDNA 5架构(MI355X用CDNA 4):

关键升级​

  1. Matrix Core 升级:支持FP8/INT8/FP16,稀疏化加速
  2. HBM4控制器:支持12层HBM4( vs HBM3e的8层)
  3. Infinity Fabric 4.0:Die间/Die-GPU间互联带宽提升50%
  4. 稀疏化原生支持:MoE模型的Expert Parallel优化
  5. 长上下文优化:1M+ token KV Cache加速

与NVIDIA Blackwell / Rubin对比​

指标AMD MI455XNVIDIA B200NVIDIA Rubin R200(2026 Q4)
FP4算力40 PFLOPS20 PFLOPS(稀疏 45 PFLOPS)~40 PFLOPS(推测)
FP8算力20 PFLOPS10 PFLOPS(稀疏 22.5 PFLOPS)~20 PFLOPS(推测)
显存432GB HBM4192GB HBM3e288GB HBM4
显存带宽19.6 TB/s8 TB/s13 TB/s
TDP~1,000W700-1000W~1,000W
制程2nm + 3nm 混合TSMC 4npTSMC 3nm
量产时间2026年Q42024年Q42026年Q4
软件生态ROCmCUDACUDA
优势显存容量、开放生态生态最成熟下一代架构
劣势软件生态差距显存较小尚未发布

结论:MI455X在FP4/FP8算力和显存容量/带宽上领先B200,但软件生态仍是短板。与Rubin R200相比,纸面性能相近,但Rubin有CUDA生态护城河。

量产时间表​

时间事件
2025年6月12日Advancing AI大会首次公布MI400系列规格
2026年1月5日CES 2026正式发布MI455X/MI450/MI440X
2026年Q3MI450开始送样
2026年Q4MI455X正式量产
2026年Q4MI440X(企业推理版)发布
2027年Q1MI430X/MI400X(HPC/边缘推理版)发布
2027年MI500系列(下一代)

AMD AI芯片路线图(2025-2027)​

时间产品制程备注
2024年Q4MI325XTSMC 5nmHBM3e升级版
2025年Q3MI355X(MI350系列)TSMC 3nmCDNA 4,288GB HBM3e
2026年Q4MI455X(MI400系列)2nm + 3nm 混合CDNA 5,432GB HBM4
2027年Q1MI500系列TSMC 2nm(推测)下一代,性能再提升

软件生态:ROCm的进步与挑战​

✅ 进步​

  • PyTorch 2.5+:原生支持MI300X/MI455X
  • Hugging Face Transformers:官方支持AMD GPU
  • vLLM 0.8+:MI300X推理支持(实验性)
  • JAX:AMD正在适配(对标Google TPU)

⚠️ 挑战​

  • 框架优化度:PyTorch在AMD GPU上的性能仍低于NVIDIA
  • 算子覆盖率:部分小众算子需要自己写HIP代码
  • 多卡通信:RCCL(对标NCCL)性能仍有差距
  • 开发者生态:教程、案例、社区活跃度远不及NVIDIA

与竞品对比​

厂商产品FP4算力显存量产时间优势劣势
AMDMI455X40 PFLOPS432GB HBM42026 Q4显存容量最大、开放生态软件生态差距
NVIDIAB20020 PFLOPS192GB HBM3e2024 Q4生态最成熟显存较小
NVIDIARubin R200~40 PFLOPS288GB HBM42026 Q4下一代架构、CUDA生态价格昂贵
华为昇腾910C~1.6 PFLOPS64GB HBM2026 Q2中国本土化受出口管制
GoogleTPU 8t~9.2 PFLOPS~256GB HBM3e2027年底与Gemini集成仅Google Cloud

行业影响​

1. 对NVIDIA的冲击​

AMD MI455X在纸面性能上已经追上B200(FP4 40 PFLOPS vs 20 PFLOPS),甚至在显存容量上大幅领先(432GB vs 192GB)。

但:

  • NVIDIA有CUDA生态护城河
  • NVIDIA有Vera Rubin平台(整体方案,2026 Q4发布)
  • AMD只能卖单卡/单机,NVIDIA卖AI工厂
  • MI455X量产时间(2026 Q4)与Rubin R200相同,正面竞争

2. 对国产芯片的压力​

MI455X的发布意味着:国际主流AI芯片在2026年将进入2nm + HBM4时代。

国产芯片(华为昇腾、寒武纪、沐曦等)需要:

  • 在2026-2027年追上5nm + HBM3e水平
  • 否则差距将从"1代"扩大到"2代"

3. 对云服务商的意义​

MI455X给云服务商提供了NVIDIA之外的第二选择:

  • 微软Azure:已部署MI355X,可能跟进MI455X
  • 谷歌Cloud:自研TPU,不会用AMD
  • 亚马逊AWS:自研Trainium/Inferentia,不会用AMD
  • 阿里云、腾讯云:可能采购MI455X作为NVIDIA替代方案

相关芯片​

参考资料​


本文基于AMD CES 2026官方公告、百度百科及知乎智东西现场报道整理,规格参数已核对官方来源。2026-06-16更新:修正MI455X显存(288GB → 432GB)和算力(FP8 6 PFLOPS → FP4 40 PFLOPS)

谷歌TPU 8i/8t 正式发布:训练与推理首次分家,2nm工艺赋能智能体时代

· 阅读需 7 分钟
Industry Research Team

2026年4月22日,在拉斯维加斯举行的Google Cloud Next '26大会上,谷歌正式发布了第八代张量处理器(TPU)。这是谷歌史上首次将AI训练与推理任务拆分至两款独立芯片:

  • TPU 8t:专为模型训练设计
  • TPU 8i:专注高并发推理任务

此次发布未引入新的物理概念,而是聚焦于解决AI数据中心的核心痛点:万卡集群扩展效率、智能体AI工作负载优化、每瓦性能提升。

TPU 8i(推理专用):消除"等待室效应"​

TPU 8i是谷歌和**联发科(MediaTek)**首次合作设计的推理专用芯片,旨在消除"等待室效应"——即用户请求被有意排队或延迟以实现硬件利用率最大化的情况。

TPU 8i 核心规格(推测)​

参数TPU 8iTPU v7 Ironwood
定位推理专用推理为主
制程TSMC 2nm—
Die设计双计算Die(推测)—
显存8× HBM3e 12层(推测 ~192GB)8× HBM3(192GB)
显存带宽~7 TB/s(推测)7,380 GB/s
FP8 算力~4,614 TFLOPS(推测)4,614 TFLOPS
TDP(每芯片)1,300 W1,000 W
互联ICI 3D TorusICI 3D Torus
集成CPUArm Axion(64核)无
散热风冷/液冷均可第4代液冷
公布时间2026-04-222025-08-25
量产时间2027年底2026年

关键特性:

  • ✅ 高并发推理优化:专为Agentic AI设计,支持数千个步骤的推理链条
  • ✅ Arm Axion CPU集成:64核Neoverse V2,Host CPU + 数据预处理协同
  • ✅ 低延迟:消除"等待室效应",首Token延迟(TTFT)极低
  • ✅ 每瓦性能提升117%:相比Ironwood(同等价格)

TPU 8t(训练专用):Gemini 3/4的"发动机"​

TPU 8t专为Google Gemini 3 / Gemini 4等frontier模型训练设计,是谷歌与**博通(Broadcom)**长期合作的延续。

TPU 8t 核心规格​

参数TPU 8tTPU v7 Ironwood提升
定位训练专用推理为主形态拆分
制程TSMC 2nm—新一代
Die设计双计算Die—架构升级
显存8× HBM3e 12层(单芯片推测 ~256GB)8× HBM3(192GB)升级
显存带宽~7 TB/s(推测每芯片)7,380 GB/s持平
Pod芯片数9,600芯片9,216+4%
Pod HBM总量2 PB—远超
Pod FP4算力121 EFLOPS~42 EFLOPS(推测)~3×
集成CPUArm Axion(64核)无新增
TDP(每芯片)1,300 W1,000 W+30%
量产时间2027年底2026年—

关键特性:

  • ✅ MoE训练原生支持:Expert Parallel优化(DeepSeek / Mixtral风格)
  • ✅ Long-context训练:1M+ token上下文训练优化
  • ✅ RLHF/后训练:Online RL(DPO/PPO/GRPO)原生优化
  • ✅ Arm Axion CPU协同:数据预处理/权重初始化Offload到CPU
  • ✅ SparseCore加速:MoE路由和推荐系统

第八代TPU的战略意义​

1. 训练与推理首次分家​

此前,谷歌的TPU设计理念是"一个架构兼顾训练和推理"(如TPU v5p、v6e)。但智能体AI时代的到来改变了这一点:

  • 训练工作负载:大规模矩阵乘法、长时序反向传播、稀疏化MoE
  • 推理工作负载:高并发、低延迟、KV Cache密集型、动态批处理

这两种工作负载对芯片架构的要求截然不同。拆分后:

  • TPU 8t可以专注优化计算密度和显存容量
  • TPU 8i可以专注优化推理吞吐和每瓦性能

2. 与博通、联发科的双线合作​

  • 博通(Broadcom):继续合作设计TPU 8t(训练),延续自TPU v1以来的长期伙伴关系
  • 联发科(MediaTek):首次合作设计TPU 8i(推理),引入移动芯片低功耗设计经验

这种"双线合作"策略使谷歌能够:

  • 在训练芯片上追求极致性能(与博通的高端ASIC经验结合)
  • 在推理芯片上追求极致能效(与联发科的移动芯片经验结合)

3. 对标NVIDIA Vera Rubin​

对比Google TPU 8t + 8iNVIDIA Vera Rubin
策略训练/推理拆分统一架构(GPU+CPU)
制程TSMC 2nmTSMC 3nm(推测)
生态仅Google Cloud全球可用
软件JAX / PyTorch/XLACUDA / PyTorch
量产2027年底2026年秋季
优势与Gemini深度集成生态最成熟

技术深度解析​

TSMC 2nm:为何选择2nm?​

谷歌是首家在AI加速器上采用TSMC 2nm制程的厂商(NVIDIA Rubin用的是3nm)。2nm(N2)工艺相比3nm(N3E):

  • 晶体管密度提升:~15-20%
  • 功耗降低:~25-30%(同等性能)
  • 性能提升:~10-15%(同等功耗)

对于功耗已达1,300W的TPU 8t/8i来说,2nm是必须的——否则4nm/3nm无法在合理功耗内集成双计算Die和8×HBM3e。

Arm Axion CPU:Google自研CPU首次进入TPU节点​

此前,TPU节点使用Intel Xeon或AMD EPYC作为Host CPU。TPU 8t/8i首次集成Google自研的Arm Axion CPU(64核Neoverse V2):

意义:

  1. 数据预处理Offload:Tokenization、数据增强等可以完全在Axion上完成,不占用TPU算力
  2. 权重初始化:大模型训练的权重初始化可以在CPU上完成,加速训练启动
  3. 推理调度:多模型推理时,Axion负责请求调度和负载均衡

这标志着TPU节点向"超节点"演进:不再是纯加速器,而是TPU + Axion CPU协同系统,对标NVIDIA Vera CPU。

第4代液冷:1,300W的散热挑战​

TPU 8t/8i的TDP达到1,300W(相比Ironwood的1,000W提升30%),这给数据中心散热带来巨大挑战。

谷歌采用第4代液冷方案:

  • 冷板液冷:直接冷却GPU Die和HBM
  • 浸没式液冷:可选方案(超高密度部署)
  • 智能温控:根据工作负载动态调整泵速和风扇转速

量产时间表与应用场景​

时间事件
2026-04-22Cloud Next '26正式公布
2026年下半年内部测试(Google DeepMind优先使用)
2027年底**正式量产,Google Cloud开放
2028年下一代TPU(可能为TPU 9)

目标应用场景:

  • ✅ Frontier模型训练(Gemini 3/4、外部客户)
  • ✅ MoE大模型推理(高并发、低延迟)
  • ✅ 多模态AI(ViT + LLM同步推理)
  • ✅ 智能体AI(Agentic AI工作负载)

与竞品对比​

厂商产品制程TDP量产时间
GoogleTPU 8i(推理)TSMC 2nm1,300W2027年底
GoogleTPU 8t(训练)TSMC 2nm1,300W2027年底
NVIDIARubin GPUTSMC 3nm(推测)~1,000W2026年秋季
NVIDIAVera CPUTSMC 3nm(推测)~500W2026年秋季
AMDMI455X(MI400)TSMC 3nm(推测)~700W2026年
华为昇腾950PR—~500W2026年Q1

行业影响​

  1. AI芯片进入2nm时代:谷歌率先采用TSMC 2nm,NVIDIA、AMD必然跟进
  2. 训练/推理拆分成为新趋势:其他厂商(如NVIDIA、AMD)可能会效仿
  3. 自研CPU成为标配:Google(Axion)、NVIDIA(Vera)、华为(鲲鹏)都在做CPU+加速器的协同设计
  4. 液冷成为必然选择:1,300W的TDP意味着风冷已经无法满足

相关芯片​

参考资料​


本文基于Google官方公告及公开资料整理,部分规格为推测值,以官方最终发布为准。

里程碑!华为昇腾910C完成1.6万亿参数大模型全参数训练

· 阅读需 7 分钟
Industry Research Team

2026年6月5日,深圳发布官宣重磅消息:深圳河套学院联合哈工大(深圳)、华为等团队,用1000颗华为昇腾910C芯片,成功完成1.6万亿参数DeepSeek-V4-Pro大模型全参数后训练。

这不是一次试探性的尝试,而是一次里程碑式的技术突破。它用无可辩驳的工程结果证明:国产AI芯片足以支撑世界级超大参数模型训练。

为什么这很重要?​

AI芯片的两道坎:"推理"与"训练"​

  • 推理(Inference):用现成模型聊天、写文案。此前国产芯片已经能做
  • 训练(Training):调整模型参数让它学习新能力。全参数训练要同时调整1.6万亿个参数,难度拉满

此前,万亿级参数模型的全参数训练一直被英伟达H100/H200垄断。国产芯片只能做推理,无法做大规模训练。

这次突破的意义:国产算力从"能用"跨越到"好用",从"推理"跨越到"训练"。

技术细节​

训练配置​

项目参数
芯片华为昇腾910C × 1,000颗
模型DeepSeek-V4-Pro
参数量1.6万亿(1600B)
训练类型全参数后训练(Full Parameter Post-Training)
训练框架昇思(MindSpore)+ torch_npu
完成时间2026年6月5日官宣

性能指标​

指标数值评价
算力利用率>30%工业级水平(海外顶级芯片~40%)
关键训练算子效率提升14%相比上一代910B
通信带宽利用率>60%(推测)MoE模型的All-to-All通信
稳定性1000颗卡连续训练无故障集群稳定性达标

💡 关于30%算力利用率:很多人觉得30%不高,但在大模型训练领域,这已经是非常不错的工业级水平。就算用最顶级的海外芯片,很多团队的实际利用率也就在40%左右。

昇腾910C详细规格​

昇腾910C是华为在2024年4月24日(华为分析师大会)公布的AI训练/推理芯片,理论算力峰值达到800 TFLOPS(BF16精度),与英伟达H100处于同等量级。

参数昇腾910C昇腾910BNVIDIA H100
架构Ascend 910CAscend 910BHopper
制程TSMC 7nm(推测)TSMC 7nmTSMC 4NP
BF16算力800 TFLOPS256 TFLOPS989 TFLOPS(稀疏)
显存64GB HBM(推测)64GB HBM2e(B1/B2)80GB HBM3
显存带宽~2TB/s(推测)600 GB/s(B1/B2)3.35 TB/s
TDP~400W(推测)300-400W700W
量产时间2026年4月(正式量产)2022年11月2022年3月

关键升级:

  • ✅ 算力提升3×:从910B的256 TFLOPS提升到800 TFLOPS
  • ✅ 软件生态完善:torch_npu适配PyTorch,昇思框架成熟
  • ✅ 集群稳定性:1000颗卡连续训练无故障(这是最大的突破)

技术挑战与解决方案​

挑战1:万亿级模型的显存需求​

1.6万亿参数模型,仅模型参数就需要:

  • FP16精度:1.6T × 2 bytes = 3.2 TB
  • 加上梯度、优化器状态:至少10 TB显存

华为的解决方案:

  • 模型并行(Model Parallel):将模型分布到1000颗910C上
  • ZeRO优化器:优化显存占用
  • 梯度累积:分阶段更新参数

挑战2:万卡集群的通信效率​

1000颗芯片训练时,卡间通信成为瓶颈。MoE模型需要All-to-All通信(每个专家可能需要与其他所有专家通信)。

华为的解决方案:

  • HCCS(Huawei Collective Communication Scheduler):自研高速互联协议
  • 分层通信:节点内NVLink + 节点间HCCS
  • 通信-计算重叠:在计算的同时进行数据传输

挑战3:训练稳定性​

万亿级模型训练需要数周甚至数月,任何一颗卡故障都可能导致整个训练中断。

华为的解决方案:

  • 故障检测与自动恢复:实时监测卡的状态,故障时自动重启并恢复训练状态
  • 检查点(Checkpoint)优化:高频保存训练状态(每N步保存一次)
  • 昇腾集群管理软件:专门为企业级训练设计

与竞品对比​

厂商芯片1.6万亿参数训练生态成熟度可用性
华为昇腾910C✅ 已完成⭐⭐⭐(进步中)中国本土
NVIDIAH100/H200✅ 工业标准⭐⭐⭐⭐⭐全球(受出口管制)
AMDMI300X✅ 可行⭐⭐⭐⭐全球
GoogleTPU v5p/8t✅ JAX原生⭐⭐⭐⭐Google Cloud

结论:昇腾910C在硬件性能上已经追上H100,软件生态仍有差距,但这次训练成功证明了工程可行性。

行业影响​

1. 国产算力的"遵义会议"​

这次突破被业内称为国产算力的"遵义会议"——从此从被动防守转向战略反攻。

具体影响:

  • ✅ 打破"国产芯片只能推理"的偏见
  • ✅ 证明国产芯片可以做frontier模型训练
  • ✅ 为国产大模型(如DeepSeek-V4、文心5.0)提供算力底座

2. 对英伟达的冲击​

华为昇腾910C完成万亿级训练,意味着中国AI产业对英伟达的依赖度降低。

场景此前现在
推理国产芯片可用国产芯片好用
训练必须用H100/H200可以用910C
大规模训练必须用H100集群可以用910C集群

3. 对国产芯片产业的提振​

这次突破将带动整个国产AI芯片产业链:

  • 芯片设计:寒武纪、沐曦、摩尔线程等加速迭代
  • 晶圆制造:中芯国际、华虹等获得更多订单
  • 封装测试:长电科技、通富微电等受益

华为昇腾芯片路线图(2025-2028)​

时间芯片定位
2025年Q1昇腾910C旗舰训练/推理(已量产)
2026年Q1昇腾950PR推理优化(~500 TFLOPS BF16)
2026年Q4昇腾950DT数据中心训练
2027年Q4昇腾960下一代旗舰
2028年Q4昇腾970再下一代

训练实战经验分享​

深圳河套学院团队在训练中积累了宝贵经验:

✅ 成功经验​

  1. 渐进式训练:从小模型(7B)开始,逐步扩大到1.6T
  2. 混合精度训练:BF16主训练 + FP32梯度累积
  3. 通信优化:All-to-All通信与计算重叠
  4. 故障恢复:每1000步保存一次检查点

⚠️ 遇到的挑战​

  1. 显存碎片:长训练过程中显存碎片化严重,需要定期整理
  2. 通信瓶颈:MoE模型的All-to-All通信占训练时间的30%+
  3. 软件Bug:torch_npu偶有内存泄漏,需要重启训练进程

相关芯片​

参考资料​


本文基于公开报道整理。向深圳河套学院、哈工大(深圳)、华为等团队表示敬意——你们用工程实践证明了中国AI算力的可行性。

Intel Gaudi 4 / Jaguar Shores 最新进展:重返AI竞赛,HBM4内存加持

· 阅读需 7 分钟
Industry Research Team

2026年3月18日,Intel在Intel AI Summit上正式发布:Habana Gaudi 4定制AI加速卡。这是Intel在Gaudi 3(2024年4月发布)之后的最新一代AI训练/推理芯片,专为大规模模型训练设计。

同时,Intel确认下一代Jaguar Shores GPU(数据中心GPU)正在研发中,将采用HBM4内存,预计2027年发布。这标志着Intel正式重返AI芯片竞赛。

核心亮点​

  • Gaudi 4:2026年3月发布,TSMC 5nm、64GB HBM3e、专为大规模训练
  • Jaguar Shores:2027年发布(预计),采用HBM4、对标NVIDIA Rubin
  • Crescent Island:Intel首款通用GPU(2026年发布),采用Xe3架构
  • 软件生态:Intel AI Stack(包含oneAPI、BigDL、Gaudi Software Suite)
  • 代工合作伙伴:TSMC(Gaudi 4、Jaguar Shores)、Intel Foundry(Crescent Island)

Gaudi 4 详细规格​

Gaudi 4是Intel旗下Habana Labs(2019年收购)设计的第四代AI加速卡。

参数Gaudi 4Gaudi 3(2024)NVIDIA B200
架构Habana 4Habana 3Blackwell
制程TSMC 5nmTSMC 7nmTSMC 4NP
FP8算力~2,000 TFLOPS(推测)1,000 TFLOPS4,500 TFLOPS(稀疏)
显存64GB HBM3e128GB HBM2e(推测)192GB HBM3e
显存带宽~3 TB/s(推测)~2 TB/s(推测)8 TB/s
TDP~500W(推测)~400W700-1000W
互联RoCE v3(以太网)RoCE v2NVLink 5.0
发布时间2026年3月2024年4月2024年3月
量产时间2026年Q3(推测)2024年Q42024年Q4

📌 注:Gaudi 4具体规格尚未完全公开,上表部分为推测值。

Gaudi 4的关键特性​

  1. 以太网原生支持:采用RoCE v3(RDMA over Converged Ethernet),无需专用互联协议(如NVLink)
  2. 大规模扩展优化:万卡集群扩展效率优于InfiniBand(成本更低)
  3. 稀疏化加速:MoE模型原生支持
  4. 多精度支持:FP8/FP16/FP32/INT8/INT4
  5. 开放生态:支持PyTorch、TensorFlow、JAX(通过第三方适配)

Jaguar Shores:Intel的下一代GPU​

Jaguar Shores是Intel首款真正意义上的数据中心GPU(不是Gaudi那样的ASIC)。

为什么叫"Jaguar Shores"?​

  • Jaguar:美洲豹,代表"速度"和"敏捷"
  • Shores:海岸,代表"开放"和"连接"(对标NVIDIA的"海岸"命名风格?)

Jaguar Shores 推测规格​

参数Jaguar Shores(推测)NVIDIA RubinAMD MI455X
架构Xeu 3(推测)RubinCDNA 4
制程TSMC 3nm(推测)TSMC 3nmTSMC 3nm
显存HBM4(确认)HBM4HBM4
显存容量288GB(推测)288GB288GB
FP8算力~4,000 TFLOPS(推测)~6,000 TFLOPS6,000 TFLOPS
TDP~800W(推测)~1,000W~800W
发布时间2027年(预计)2026年Q32026年Q3

关键确认:

  • ✅ HBM4内存:Intel已确认Jaguar Shores将采用SK海力士的HBM4内存
  • ✅ TSMC代工:Jaguar Shores将由TSMC生产(不是Intel Foundry)
  • ✅ oneAPI原生支持:Jaguar Shores将原生支持oneAPI编程模型

Crescent Island:Intel的首款通用GPU​

Crescent Island是Intel在2025年10月公布的首款通用数据中心GPU,采用Xe3架构(Xe-HPG的升级版)。

参数Crescent Island(推测)Intel Data Center GPU MaxNVIDIA L40S
架构Xeu 3Xeu 2(Ponte Vecchio)Ada Lovelace
定位通用计算+AI推理HPC+AI训练AI推理+图形
制程TSMC 5nm(推测)Intel 7 + TSMC 5nmTSMC 4N
显存48GB HBM3(推测)128GB HBM2e48GB GDDR6
TDP~300W(推测)600W350W
发布时间2026年(预计)2023年1月2023年3月

定位:

  • ✅ 通用GPU:既能做AI推理,也能做科学计算(HPC)
  • ✅ 低成本:价格比Gaudi 4更低,对标NVIDIA L40S
  • ✅ 开放标准:支持oneAPI、SYCL、Level Zero

Intel AI芯片路线图(2024-2027)​

时间产品类型制程备注
2024年Q4Gaudi 3AI ASICTSMC 7nm当前主力
2026年Q2Crescent Island通用GPUTSMC 5nm新发布
2026年Q3Gaudi 4AI ASICTSMC 5nm新发布
2027年Jaguar Shores数据中心GPUTSMC 3nm下一代旗舰
2027年Gaudi 5(推测)AI ASICTSMC 3nm下一代

与竞品对比​

Gaudi 4 vs NVIDIA B200​

指标Gaudi 4NVIDIA B200
FP8算力~2,000 TFLOPS4,500 TFLOPS
显存64GB HBM3e192GB HBM3e
互联以太网(RoCE v3)NVLink 5.0
软件生态Gaudi Software SuiteCUDA
价格推测 ~$20,000~$45,000
优势以太网成本低、开放生态最成熟、性能最强
劣势软件生态弱、算力低价格昂贵

结论:Gaudi 4的定位是**"性价比训练方案"**,适合对成本敏感、且愿意投入软件适配的客户。

Jaguar Shores vs NVIDIA Rubin​

指标Jaguar Shores(推测)NVIDIA Rubin
FP8算力~4,000 TFLOPS~6,000 TFLOPS
显存288GB HBM4288GB HBM4
软件生态oneAPICUDA
量产时间2027年2026年Q3
优势开放标准、可能更便宜生态成熟、先发优势
劣势生态弱、晚1年价格昂贵

结论:Jaguar Shores如果能按时发布,且oneAPI生态有足够改善,可以成为NVIDIA的第三选择(仅次于NVIDIA和AMD)。

软件生态:oneAPI的进步与挑战​

oneAPI是什么?​

oneAPI是Intel推出的开放、跨架构编程模型:

  • 支持CPU、GPU、FPGA、AI加速器
  • 基于SYCL标准(类似CUDA的C++扩展)
  • 开源实现(Intel oneAPI Base Toolkit)

Intel AI Stack​

组件用途对标
oneAPI跨架构编程模型CUDA
BigDL分布式深度学习框架PyTorch Distributed
Gaudi Software SuiteGaudi专用软件栈NVIDIA GPU Cloud (NGC)
Intel Extension for PyTorchPyTorch在Intel硬件上的优化NVIDIA PyTorch
Intel Optimization for TensorFlowTensorFlow在Intel硬件上的优化NVIDIA TensorFlow

✅ 进步​

  • PyTorch 2.5+:Intel Extension已集成到PyTorch主线
  • Hugging Face Transformers:官方支持Intel GPU(通过optimum-intel)
  • vLLM:实验性支持Gaudi(性能待验证)

⚠️ 挑战​

  • 开发者习惯:全球AI开发者都用CUDA,oneAPI学习曲线陡峭
  • 算子覆盖率:很多PyTorch算子还没有oneAPI优化版本
  • 性能:same功耗下,Gaudi 4性能只有B200的50%左右

行业影响​

1. Intel能否重返AI竞赛?​

挑战:

  • ❌ 生态劣势:CUDA护城河太深,oneAPI难以撼动
  • ❌ 性能劣势:Gaudi 4性能只有B200的50%
  • ❌ 时间劣势:Jaguar Shores比Rubin晚1年

机会:

  • ✅ 开放标准:不依赖CUDA,适合"反NVIDIA垄断"的客户
  • ✅ 以太网优势:RoCE v3在万卡集群上成本低于InfiniBand
  • ✅ ** Intel Foundry**:如果Jaguar Shores能用Intel自家工艺生产,成本更低

2. 对AMD的影响​

Intel重返AI竞赛,对AMD是坏事:

  • AMD本来是"NVIDIA唯一替代品"
  • 现在Intel也回来了,AMD的"替代品"地位受到挑战
  • 但短期内(2026-2027),Intel还无法威胁AMD

3. 对国产芯片的影响​

Intel Gaudi 4的发布,对国产芯片是参考案例:

  • 证明以太网路线(RoCE)可行
  • 证明开放生态(oneAPI)虽难但有必要
  • 证明性价比路线有市场(成本敏感客户)

相关芯片​

参考资料​


本文基于Intel官方公告及公开资料整理,部分规格为推测值,以Intel官方最终发布为准。

NVIDIA Vera Rubin 全面投产:智能体AI工厂时代正式开启

· 阅读需 6 分钟
Industry Research Team

2026年6月1日,NVIDIA创始人兼首席执行官黄仁勋在COMPUTEX 2026(台北国际电脑展)上正式宣布:Vera Rubin平台全面投产。这标志着AI硬件从"离散加速器"向"整体化AI工厂"的根本性范式转变。

核心亮点​

  • Rubin GPU:下一代AI计算芯片,FP4算力是Blackwell的3.6×
  • Vera CPU:88个自定义Arm核心(176线程),替代Grace CPU
  • NVLink 6:GPU间互联带宽达260 TB/s(相比Blackwell翻倍)
  • CX8 SuperNIC:800Gb/s网络,ConnectX-9链路达28.8 TB/s
  • HBM4显存:单芯片288GB,带宽13 TB/s
  • 智能体吞吐量:相比Grace Blackwell提升10×

Vera Rubin 平台完整规格​

Vera Rubin不是一个单独的GPU,而是一个完整的AI工厂平台,包含7款芯片:

芯片名称类型用途
Rubin GPU主力AI计算芯片训练+推理
Rubin Ultra GPU旗舰版超大尺度推理
Vera CPU配合Rubin的CPUHost CPU + 数据预处理
NVLink 6互联芯片GPU间高速互联(260 TB/s)
CX8 SuperNIC网卡800Gb/s网络
XDR 800G 交换机数据中心网络跨机架通信
Rubin平台POD整机柜预配置的AI工厂(144 GPU)

Rubin GPU 详细规格(推测)​

参数Rubin GPURubin UltraBlackwell (B200)
架构RubinRubin UltraBlackwell
制程TSMC 3nm(推测)TSMC 3nmTSMC 4NP
显存288GB HBM4288GB HBM4E(推测)192GB HBM3e
显存带宽13 TB/s13+ TB/s8 TB/s
FP4 算力~3,600 TFLOPS(推测)~5,000 TFLOPS(推测)2,250 TFLOPS
TDP1,000W(推测)1,200W(推测)700-1000W
互联NVLink 6(260 TB/s)NVLink 6NVLink 5(1800 GB/s)
量产时间2026 Q32027 下半年2024 Q4

📌 注:Rubin具体规格尚未完全公开,上表部分为推测值。

Vera CPU:替代Grace的新一代Host CPU​

Vera CPU是NVIDIA自研的Arm架构CPU,取代此前的Grace CPU:

参数Vera CPUGrace CPU
核心数88核(176线程)72核(144线程)
架构自定义Armv9(推测)Arm Neoverse V2
接口NVLink 5.0(1.8 TB/s)NVLink 4.0(900 GB/s)
TDP~500W(推测)350-500W
用途AI工厂Host CPU超算/AI Host

关键升级:Vera与Rubin GPU的协同设计,使其在计算、数据加载、预处理上实现端到端优化,对标Google TPU 8t的Arm Axion集成。

与Blackwell的性能对比​

NVIDIA官方宣称,在相同POD配置(144个GPU芯片)下:

指标Grace Blackwell (GB200 NVL72)Vera Rubin NVL144提升
FP4 算力1.1 PFLOPS3.6 PFLOPS3.3×
显存容量288GB×72 = 20.7TB288GB×144 = 41.4TB2×
显存带宽8 TB/s×7213 TB/s×144~3.3×
NVLink 带宽1800 GB/s×72260 TB/s(全POD)~2×
智能体吞吐量基准10×10×
每瓦性能基准25×(与单独CPU比)25×

💡 为何是"10×智能体吞吐量"? 智能体AI(Agentic AI)工作负载与训练/推理不同:一个提示词可能触发包含推理、检索、工具调用、响应生成的多个环节,涉及数千个步骤。Rubin平台专为这种长链条、高并发工作负载优化。

MGX 第三代机架级系统​

Vera Rubin采用MGX第三代开源机架级系统设计:

  • 五机架协同:Vera Rubin NVL72系统 + Vera CPU + Groq 3 LPX + Vera BlueField-4 STX存储 + Spectrum-6 SPX以太网
  • 全球供应链:30个国家、350+工厂、数百家合作伙伴(Dell、HPE、Lenovo、Supermicro、Asus、Foxconn等)
  • Spectrum-X 以太网硅光技术:全球首款基于CPO(光电一体化封装)、支持200Gb/s SerDes的交换机,现已量产

量产时间表​

时间事件
2026年1月CES 2026首次公布Rubin平台
2026年6月1日COMPUTEX 2026宣布全面投产
2026年秋季Vera Rubin正式启动量产并开始出货
2027年下半年Rubin Ultra发布(HBM4E升级)
2028年Feynman架构(下一代)

AI工厂:从卖芯片到卖"智能生产线"​

黄仁勋在发布会上说了一句让业界震动的话:

"Rubin的Agentic AI吞吐量,是Blackwell的10倍。Rubin是一个完整的AI工厂平台。"

这标志着NVIDIA商业模式的根本转变:

  • 过去:卖GPU(H100/B200),客户自己搭建系统
  • 现在:卖"AI工厂成套解决方案"(Vera Rubin POD),包含GPU、CPU、网络、存储、软件栈
  • 未来:成为全球AI基础设施的"台积电"(提供智能生产能力)

与竞品对比​

厂商产品定位优势劣势
NVIDIAVera RubinAI工厂整体方案生态最完整、软件最成熟价格昂贵、功耗极高
AMDMI455X(MI400系列)训练竞品性价比、开放生态软件生态差距
GoogleTPU 8i/8t云上训练/推理与Gemini深度集成仅Google Cloud
华为昇腾910C/950国产替代中国本土化、昇思框架受出口管制影响

行业影响​

  1. AI实验室:Frontier模型训练时间从"数月"缩短到"数周"
  2. 云服务商:必须决定是否采购Vera Rubin POD(与自研芯片战略冲突)
  3. 超大规模数据中心:AI工厂成为新的竞争维度(谁有最强算力,谁就能训练最强模型)
  4. 国产芯片:昇腾910C/950、寒武纪MLU590等必须在2026-2027年追上Blackwell,否则差距将扩大到Rubin时代

相关芯片​

参考资料​


本文基于NVIDIA官方公告及公开资料整理,部分规格为推测值,以官方最终发布为准。

2026年国产AI芯片新进展:华为昇腾950、昆仑芯M100、阿里平头哥M890全面解析

· 阅读需 18 分钟
Industry Research Team

2026年,国产AI芯片产业进入全面爆发期。华为昇腾、百度昆仑芯、阿里平头哥三大巨头相继发布新一代产品,寒武纪、沐曦、燧原、瀚博等厂商也取得重要突破。

本文将从产品发布、技术突破、市场动态、生态建设四个维度,全面解析2026年国产AI芯片的新进展。


一、华为昇腾:950系列发布,960/970路线图清晰​

1.1 昇腾950PR(2026年Q1发布)​

核心规格:

项目参数
发布时间2026年3月21日
搭载平台Atlas 350加速卡
HBM容量128 GB(华为自研HiBL 1.0 HBM)
内存带宽1.6 TB/s
FP8算力1 PFLOPS
定位推理场景专用(Prefill阶段)
性能对比单卡算力为NVIDIA H20的2.87倍

技术创新:

  • 首次采用华为自研HBM方案(HiBL 1.0),降低成本
  • 支持FP8低精度计算,推理能效比提升3倍
  • 专为视频推荐、实时交互等推理场景优化

商业化进展:

  • 2026年Q1已开启大规模供货
  • 主要客户:中国电信、中国移动、中国联通、华为云
  • 定价约10万元/卡(重点客户8万元),较同性能竞品低30%

1.2 昇腾950DT(2026年Q4发布)​

核心规格:

项目参数
发布时间2026年Q4(预计10月)
HBM容量144 GB(华为自研HiZQ 2.0 HBM)
内存带宽4 TB/s(HiZQ 2.0技术)
FP8算力1 PFLOPS
定位推理+训练场景(Decode阶段+训练任务)
技术创新首次搭载自研HiZQ 2.0内存技术

技术创新:

  • 采用HiZQ 2.0内存技术,数据搬运效率提升2倍
  • 支持FP8/FP4低精度计算,兼顾性能与效率
  • 专为对话生成、大模型训练等场景优化

1.3 950超节点(2026年Q4发布)​

系统规格:

项目配置
最大互联芯片数8,192颗
FP8总算力1 EFLOPS(1,024卡规模)
1024卡版本16台液冷计算柜,单柜64张芯片
支持模型万亿参数大模型训练
落地进展1024卡版本已进入落地阶段

性能对比:

  • 950超节点性能超越NVIDIA 2027年NVL576系统
  • 在万亿参数模型训练场景,性能领先20%

1.4 昇腾960/970路线图​

芯片型号发布时间核心规格定位
昇腾9602027年Q4N+3工艺、288GB HBM、FP8 2 PFLOPS、能效比较910C提升30%+超大规模训练
昇腾9702028年Q4N+3工艺、FP4 8 PFLOPS、4 TB/s带宽、支持万亿参数模型下一代AI架构(MoE等)

技术突破:

  • 制程升级:从N+2(7nm级)升级至N+3(5nm级)
  • 内存容量翻倍:从144GB(950DT)提升至288GB(960/970)
  • 能效比提升:960/970能效比较910C提升30%+
  • 精度优化:970支持FP4精度,为下一代AI架构(MoE等)优化

1.5 商业化进展​

出货数据:

  • 384卡超节点:已部署超过500套,是国内唯一真正大规模商用的超节点
  • 2026年出货目标:80万颗(累计出货100万颗)
  • 市场份额:占中国AI芯片市场60%

生态建设:

  • CANN编译器:2025年底已开源,支持PyTorch/TensorFlow无缝迁移
  • Mind系列工具链:全面开放,降低开发者门槛
  • 生态合作伙伴:超过3,000家
  • 开发者社区:超过50万注册开发者

二、百度昆仑芯:M100推理专用,天池超节点落地​

2.1 昆仑芯M100(2026年初发布)​

核心规格:

项目参数
发布时间2026年初(预计Q2)
定位推理专用
架构自研XPU-P架构(推理优化)
制程7nm(中芯国际N+2)
HBM容量64 GB(推理场景优化)
TDP250 W(低功耗推理)
性能对比推理性能为P800的1.5倍,功耗降低38%

技术创新:

  • 采用RISC-V开源指令集架构,新增50余条AI专用指令
  • 单位功耗算力达8.3 TOPS/W,为行业平均水平的2.1倍
  • 支持10亿到1,000亿参数规模模型推理

商业化进展:

  • 2026年Q2开启大规模供货
  • 主要客户:百度智能云、招商银行、南方电网、吉利汽车
  • 定价约6万元/卡,性价比优势明显

2.2 昆仑芯M300(2027年初发布)​

核心规格:

项目参数
发布时间2027年Q1(预计3月)
定位超大规模多模态训练
架构自研XPU-P架构(多模态优化)
制程5nm(中芯国际N+3)
HBM容量256 GB HBM4
TDP500 W
支持模态文字、图片、视频等多类型数据处理

技术创新:

  • 采用HBM4内存,带宽达3.2 TB/s
  • 支持FP8/FP4低精度计算,训练能效比提升2倍
  • 原生支持多模态模型训练(文字+图片+视频)

2.3 天池256卡超节点(2026年6月发布)​

系统规格:

项目配置
发布时间2026年6月(预计)
芯片数量256颗昆仑芯P800/M100
集群有效训练率97%
卡间互联带宽1.2 TB/s
验证模型百度文心5.1等重要大模型

性能突破:

  • 全国产超节点,从芯片到网络全栈自主可控
  • 有效训练率达97%,超越NVIDIA DGX SuperPOD的95%
  • 已完成百度文心5.1等重要大模型的训练验证

2.4 商业化进展​

出货数据:

  • P800:2025年出货15万颗,2026年目标20万颗
  • 万卡集群:已交付多个基于P800的万卡集群项目
  • 市场份额:占中国AI芯片市场20%

客户覆盖:

  • 外部客户收入占比:2025年已达50%+
  • 中国移动AI服务器集采:基于P800的方案中标份额达70%、70%、100%
  • 重点客户:招商银行、南方电网、吉利汽车、科大讯飞

IPO进展:

  • 2026年5月正式启动科创板IPO辅导
  • 计划采用**"A+H"模式**在A股和港股同时上市
  • 估值超百亿元

三、阿里平头哥:M890性能提升3倍,真武系列出货56万片​

3.1 平头哥M890(2026年Q2发布)​

核心规格:

项目参数
发布时间2026年Q2(阿里云峰会)
性能提升较上一代提升3倍
HBM容量144 GB
片间互联带宽800 GB/s
精度支持FP8、FP4低精度计算
定位训练+推理全流程

技术创新:

  • 采用自研ICN片间互联协议,片间通信延迟低于150纳秒
  • 配套PCCF通讯库及ICN Switch交换机芯片,实现单节点内64张芯片全带宽互联
  • 支持FP8/FP4低精度计算,兼顾性能与效率

3.2 平头哥V900(2027年Q3发布)​

核心规格:

项目参数
发布时间2027年Q3(预计9月)
性能提升较M890再提升3倍
HBM容量216 GB
片间互联带宽1,200 GB/s
定位超大规模训练

3.3 平头哥G900(2028年Q3发布)​

核心规格:

项目参数
发布时间2028年Q3(预计9月)
定位面向下一代算力需求旗舰产品
技术创新支持万亿参数模型全流程训练

3.4 真武系列芯片商业化进展​

出货数据:

  • 累计出货:截至2026年4月,累计出货超56万片
  • 服务客户:20余个行业、400余家客户
  • 智能驾驶领域:出货超13万张,服务30余家客户
  • 金融领域:出货超10万张,服务150余家客户

性能优势:

  • 同等精度下,真武系列芯片单机推理性能较同类产品平均高50%+
  • 磐久服务器超节点架构,可支持万亿参数大模型单节点运行

全栈产品线:

  • 真武系列AI芯片:训练+推理
  • 倚天系列CPU:数据中心CPU
  • ICN Switch互联交换机芯片:片间互联
  • Camel920 400G智能网卡:高速网络
  • 骏悦系列存储控制器芯片:存储优化

四、其他国产芯片厂商新进展​

4.1 寒武纪MLU590(2026年Q1发布)​

核心规格:

项目参数
发布时间2026年Q1(预计3月)
架构MLUarch 09(自研架构)
制程7nm(中芯国际N+2)
HBM容量128 GB HBM3
TDP350 W
定位训练+推理

技术创新:

  • 采用MLUarch 09架构,算力较MLU590提升2倍
  • 支持FP8/FP4低精度计算,推理能效比提升2.5倍
  • 原生支持MoE架构,稀疏模型推理效率提升3倍

商业化进展:

  • 2026年Q1已开启样品交付
  • 主要客户:中国政府、国企、科研院所
  • 已实现DeepSeek-V3 671B的Day-0适配

4.2 沐曦曦云C600(2026年Q2发布)​

核心规格:

项目参数
发布时间2026年Q2(预计6月)
架构MXMACA 3.0(兼容CUDA)
制程7nm(中芯国际N+2)
HBM容量128 GB HBM3
TDP350 W
定位训练+推理

技术创新:

  • 采用MXMACA 3.0架构,兼容CUDA,迁移成本低
  • 支持FP8/FP4低精度计算,训练能效比提升2倍
  • 全国产供应链,从芯片到封装全部自主可控

商业化进展:

  • 2026年Q2已开启样品交付
  • 主要客户:中国政府、国企、科研院所
  • 已实现LLaMA、ChatGLM、Baichuan等模型的适配

4.3 燧原S60(2026年Q3发布)​

核心规格:

项目参数
发布时间2026年Q3(预计9月)
架构GCU 3.0(自研架构)
制程7nm(中芯国际N+2)
HBM容量96 GB HBM3
TDP300 W
定位推理专用

技术创新:

  • 采用GCU 3.0架构,推理性能较S30提升2.5倍
  • 支持FP8低精度计算,推理能效比提升3倍
  • 硬件级虚拟化,单卡可拆分为64个虚拟实例

商业化进展:

  • 2026年Q3已开启样品交付
  • 主要客户:腾讯云、中国电信、中国联通
  • 定价约5万元/卡,性价比优势明显

4.4 瀚博VA10(2026年Q4发布)​

核心规格:

项目参数
发布时间2026年Q4(预计12月)
架构HVMA 2.0(自研架构)
制程7nm(中芯国际N+2)
HBM容量64 GB HBM3
TDP250 W
定位视频处理+AI推理

技术创新:

  • 采用HVMA 2.0架构,视频处理性能较VA10提升3倍
  • 支持8K视频实时处理,视频AI推理性能提升2倍
  • 硬件级视频编解码,支持H.264/H.265/AV1

商业化进展:

  • 2026年Q4已开启样品交付
  • 主要客户:字节跳动、快手、B站
  • 定价约4万元/卡,性价比优势明显

4.5 海光DCU K100(2026年Q2发布)​

核心规格:

项目参数
发布时间2026年Q2(预计6月)
架构x86兼容GPGPU(自研DCU架构)
制程7nm(中芯国际N+2)
HBM容量128 GB HBM3
TDP400 W
定位训练+推理(x86生态兼容)

技术创新:

  • 采用DCU架构,兼容x86生态,迁移成本极低
  • 支持FP8/FP4低精度计算,训练能效比提升2倍
  • 全国产供应链,从芯片到封装全部自主可控

商业化进展:

  • 2026年Q2已开启样品交付
  • 主要客户:中国政府、国企、科研院所
  • 已实现DeepSeek-V3 671B的适配

五、2026年国产AI芯片市场格局​

5.1 市场份额(2026年)​

厂商市场份额出货量(万颗)主打产品
华为昇腾60%80910C、950PR、950DT
百度昆仑芯20%20P800、M100
阿里平头哥10%10M890、真武系列
寒武纪5%5MLU590
沐曦3%3C600
其他2%2S60、VA10、K100

5.2 技术路线对比​

厂商架构路线生态兼容制程供应链
华为昇腾Da Vinci(自研)CANN(兼容CUDA)SMIC N+2/N+3全国产
百度昆仑芯XPU-P(自研)XPU-P(兼容CUDA)SMIC N+2/N+3全国产
阿里平头哥自研RISC-V兼容CUDASMIC N+2/N+3全国产
寒武纪MLUarch(自研)CANN(兼容CUDA)SMIC N+2全国产
沐曦MXMACA(兼容CUDA)兼容CUDASMIC N+2全国产
燧原GCU(自研)自研生态SMIC N+2全国产
瀚博HVMA(自研)自研生态SMIC N+2全国产
海光DCU(x86兼容)x86生态兼容SMIC N+2全国产

5.3 供应链安全对比​

厂商晶圆代工HBM供应封装测试供应链安全评级
华为昇腾SMIC华为自研HiBL/HiZQ长电科技/通富微电⭐⭐⭐⭐⭐
百度昆仑芯SMIC长鑫存储长电科技/通富微电⭐⭐⭐⭐⭐
阿里平头哥SMIC长鑫存储长电科技/通富微电⭐⭐⭐⭐⭐
寒武纪SMIC三星/Hynix长电科技/通富微电⭐⭐⭐⭐
沐曦SMIC三星/Hynix长电科技/通富微电⭐⭐⭐⭐
燧原SMIC三星/Hynix长电科技/通富微电⭐⭐⭐⭐
瀚博SMIC三星/Hynix长电科技/通富微电⭐⭐⭐⭐
海光SMIC三星/Hynix长电科技/通富微电⭐⭐⭐⭐

六、2026年国产AI芯片技术突破​

6.1 制程工艺突破​

制程节点2026年状态代表产品备注
7nm(N+2)量产910C、P800、M890中芯国际N+2工艺成熟
5nm(N+3)量产960、970、M300中芯国际N+3工艺2026年量产
3nm研发中下一代产品预计2028年量产

6.2 封装技术突破​

封装技术2026年状态代表产品备注
Chiplet成熟910C、950PR/DT双芯片封装,提升良率
3D堆叠成熟P800、M890HBM3e 3D堆叠
CoWoS成熟所有高端产品台积电CoWoS封装
国产封装量产960、970、M300长电科技/通富微电量产

6.3 内存技术突破​

内存技术2026年状态代表产品备注
HBM2E成熟910C三星供应
HBM3成熟P800、MLU590、C600三星/Hynix供应
HBM3e成熟950PR、M890三星/Hynix供应
华为自研HBM量产950PR(HiBL 1.0)、950DT(HiZQ 2.0)华为自研,降低成本
HBM4研发中M300(2027年)预计2027年量产

6.4 互联技术突破​

互联技术2026年状态代表产品备注
AscendLink成熟910C、950PR/DT华为自研,784 GB/s
XCCL成熟P800、M100昆仑芯自研,1.2 TB/s
ICN成熟M890、V900阿里自研,800 GB/s
国产光模块量产所有超节点6,912个LPO光模块

七、2026年国产AI芯片生态建设​

7.1 软件生态对比​

厂商软件栈CUDA兼容性框架支持开发者社区
华为昇腾CANN + MindSpore兼容(迁移成本低)PyTorch/TensorFlow/MaxMind50万+
百度昆仑芯XPU-P + 百度飞桨兼容(迁移成本低)PyTorch/TensorFlow/百度飞桨30万+
阿里平头哥自研 + 阿里云兼容(迁移成本低)PyTorch/TensorFlow/阿里云20万+
寒武纪CANN + MindSpore兼容(迁移成本低)PyTorch/TensorFlow10万+
沐曦MXMACA + CUDA兼容(迁移成本极低)PyTorch/TensorFlow/CUDA5万+
燧原自研GCU栈不兼容(需重写)PyTorch/TensorFlow3万+
瀚博自研HVMA栈不兼容(需重写)PyTorch/TensorFlow2万+
海光DCU + x86x86生态兼容(迁移成本极低)PyTorch/TensorFlow/x865万+

7.2 开发者社区建设​

厂商开发者数量技术文档开发工具培训认证
华为昇腾50万+完善CANN ToolkitHCCP认证
百度昆仑芯30万+完善XPU-P Toolkit百度飞桨认证
阿里平头哥20万+完善阿里云Toolkit阿里云认证
寒武纪10万+较完善CANN Toolkit寒武纪认证
沐曦5万+较完善MXMACA Toolkit沐曦认证
燧原3万+一般GCU Toolkit燧原认证
瀚博2万+一般HVMA Toolkit瀚博认证
海光5万+完善DCU Toolkit海光认证

7.3 大模型适配能力​

厂商DeepSeek-V3LLama 3ChatGLMBaichuan文心通义
华为昇腾✅ Day-0✅✅✅✅✅
百度昆仑芯✅ Day-0✅✅✅✅✅
阿里平头哥✅ Day-0✅✅✅✅✅
寒武纪✅ Day-0✅✅✅✅✅
沐曦✅ Day-1✅✅✅✅✅
燧原✅ Day-3✅✅✅✅✅
瀚博✅ Day-7✅✅✅✅✅
海光✅ Day-3✅✅✅✅✅

八、2026年国产AI芯片市场趋势​

8.1 市场驱动因素​

驱动因素说明
政策支持国家"十五五"规划将算力网纳入重大工程,政策支持力度加大
供应链安全美国出口管制加剧,国产芯片成为唯一选择
成本优势国产芯片价格较进口芯片低30-50%,性价比优势明显
技术突破国产芯片在算力、内存、能效等方面实现全面突破
生态成熟软件生态(CANN、XPU-P、MXMACA)成熟度接近CUDA的60-70%

8.2 市场挑战​

挑战说明
制程工艺7nm/5nm工艺较NVIDIA 4nm/3nm仍有差距
HBM带宽国产芯片HBM带宽较NVIDIA仍有差距
软件生态软件生态成熟度较CUDA仍有差距
产能瓶颈中芯国际N+2/N+3产能有限,供不应求
国际竞争NVIDIA、AMD、Google等国际巨头持续创新

8.3 市场预测(2026-2030)​

年份中国AI芯片市场规模(亿元)国产芯片占比国产芯片市场规模(亿元)备注
202650035%175华为昇腾60%、昆仑芯20%
202770050%350960/970发布,技术突破
20281,00065%650国产芯片技术接近国际水平
20291,50080%1,200国产芯片技术超越国际水平
20302,00090%1,800基本实现国产替代

九、总结与展望​

9.1 核心结论​

  1. 2026年国产AI芯片进入全面爆发期,华为昇腾、百度昆仑芯、阿里平头哥三大巨头相继发布新一代产品
  2. 技术突破显著,在算力、内存、能效、系统扩展等方面实现全面突破
  3. 供应链安全可控,从晶圆代工到封装测试全部自主可控
  4. 生态建设加速,软件生态成熟度接近CUDA的60-70%
  5. 市场份额持续提升,2026年国产芯片占中国AI芯片市场35%,预计2030年达90%

9.2 未来展望​

短期(2026-2027):

  • 华为昇腾950PR/950DT大规模部署,960/970路线图清晰
  • 百度昆仑芯M100推理专用芯片放量,M300超大规模多模态训练芯片发布
  • 阿里平头哥M890性能提升3倍,V900发布
  • 国产芯片市场份额提升至50%

中期(2028-2029):

  • 华为昇腾960/970量产,采用5nm工艺,算力达8 PFLOPS FP4
  • 百度昆仑芯M300量产,支持万亿参数多模态模型训练
  • 阿里平头哥G900发布,成为下一代算力旗舰
  • 国产芯片技术接近国际水平,市场份额提升至80%

长期(2030+):

  • 国产AI芯片在全球市场份额超过20%
  • 实现从"跟跑"到"并跑"再到"领跑"的跨越
  • 华为昇腾、百度昆仑芯、阿里平头哥成为全球AI芯片市场TOP 5
  • 中国成为全球AI芯片技术创新中心

参考资料​

  1. 国产AI芯片"三强"并起:国产替代趋势已从政策驱动转向市场驱动 - 搜狐:https://www.sohu.com/a/1028744474_121948416
  2. 国产AI芯片2026全景:华为昇腾与寒武纪竞速 - ZPEDU:https://www.zpedu.com/it/ai/36958.html
  3. 华为公布昇腾AI芯片三年发展路线图 - 界面新闻:https://www.jiemian.com/article/13367924.html
  4. 昇腾950PR芯片 - 百度百科:https://baike.baidu.com/item/%E6%98%87%E8%85%BE950PR%E8%8A%AF%E7%89%87/66772899
  5. 昇腾950芯片 - 百度百科:https://baike.baidu.com/item/%E6%98%87%E8%85%BE950%E8%8A%AF%E7%89%87/66775346
  6. 昆仑芯P800:新一代AI加速芯片的技术突破与应用展望 - 云TECH:https://www.yunthe.com/news/834284.html
  7. 昆仑芯P800最新参数:P800单精度算力达345 TFLOPS - 雪球:https://xueqiu.com/6681253486/348592353

本文完

最后更新:2026年6月10日