Skip to main content

寒武纪 MLU690 深度解析:700+ TFLOPS FP16 与国产训练卡的寒武纪时刻

· 6 min read
Industry Research Team

在华为昇腾与英伟达的双雄叙事之外,寒武纪正在写下国产 AI 芯片的第三条故事线:思元690 以 700+ TFLOPS FP16 登顶国产纸面算力,公司实现首次年度盈利,下一代芯片未发先涨 20%–30%。这个曾经靠情怀撑估值的"AI 芯片第一股",第一次同时握住了技术、商业与定价权三张牌。

一、思元690 核心规格:196GB HBM3 撑起的算力天花板​

按本站芯片卡收录的规格,思元690(MLU690)采用双 die Chiplet 封装,2026 年初量产,核心参数如下:

项目参数
架构新一代 MLUarch 架构
制程中芯国际 N+2(5nm 级),亦见台积电 4nm 双 die 报道
显存196 GB HBM3
显存带宽3.35 TB/s
FP16/BF16700+ TFLOPS
INT42800+ TOPS
互联MLU-Link 890 Gbps/卡
TDP400–500 W
单价¥14–15 万

与上代思元590 相比,这是一次全面换代;与 H100 相比,则是典型的"错位竞争":

指标思元690思元590H100 SXM对比 H100
显存196GB HBM396GB HBM2e80GB HBM32.45×
显存带宽3.35 TB/s~2 TB/s3.35 TB/s持平
FP16700+ TFLOPS345 TFLOPS989 TFLOPS~71%
INT8 推理反超(INT4 2800+ TOPS 口径)1380 TOPS1979 TOPS部分场景反超

196GB 显存是思元690 最锋利的差异化武器:单卡装下更大的模型与 KV Cache,在推理场景性价比突出;纯推理场景可达到 H100 的 80%–90%。短板同样清晰——FP16 训练算力与千卡以上分布式训练的互联工程成熟度。为此,WAIC 2026 上寒武纪同步落地了 256 卡规模超节点集群方案,已在多地智算中心部署,从"单卡算力"走向"系统级算力"。

二、架构演进:MLUarch 换代与 HBM3 上量​

思元690 的代际跃迁体现在三处:其一,MLUarch 架构换代(市场披露口径称新一代芯片采用 MLUarch 04),配合双 die Chiplet 封装,把晶体管预算投向张量算力与显存通道;其二,显存从 HBM2e 一举上量到 196GB HBM3,3.35 TB/s 带宽与 H100 持平——在国产供应链里率先解决"内存墙";其三,MLU-Link 890 Gbps 卡间互联已接近 NVLink 4 的 900 GB/s 量级,为 256 卡超节点铺路。软件侧的 NeuWare 是国内少有的云边端统一栈:PyTorch/TensorFlow 适配版、NeuBLAS、NeuDNN,以及全球首批商用 MLIR 图编译推理框架 MagicMind。

供应链上,台积电因实体清单停供后,寒武纪全线转向中芯国际 N+2,成为中芯先进制程的最大客户之一;N+2 产能已锁定至 2027 年。

三、涨价 20%–30%:国产芯片第一次掌握定价权​

路透社 2026 年 9 月 10 日报道:寒武纪下一代芯片(市场暂称"690")重新定价,较两个月前上涨 20%–30%。同期昇腾 950DT 报价突破 25 万元、沐曦、天数智芯等国产卡也集体上调 20%–30%——这不是寒武纪一家的孤例,而是 HBM 成本飙升叠加供不应求下的全行业现象。

值得注意的是官方态度:寒武纪董秘办回应"不要听信市场消息,一切以官方公告为准"。渠道价与官方定价之间存在明显温差——涨价是市场现实,但公司不愿为渠道炒作背书。这背后是国产 AI 芯片定价权的历史性变化:过去国产卡必须以"替代品折价"换取订单,如今供给稀缺让定价逻辑转向"稀缺溢价"。在华为、寒武纪、摩尔线程构成的国产三强格局中,寒武纪第一次拥有了"不降价也能卖动"的底气。

四、首次年度盈利:商业模式的拐点​

如果说涨价反映的是市场热度,盈利则验证了商业模式的成色。按 2026 年上半年行业复盘口径,寒武纪已实现首次年度盈利。配套数据同样亮眼:2026 年 Q1 营收 28.85 亿元,同比增长 160%;2026 年 6 月市值突破万亿元。客户结构上,字节跳动是最大客户(思元580/590/690 合计采购超 50 万颗,约占其采购的 65%),阿里、百度、中国移动相继进入订单名单。

"首次盈利"对国产 AI 芯片行业的标志意义在于:这个赛道第一次出现了不依赖补贴与融资、靠卖芯片本身赚钱的商业模式。研发投入可以自我造血,意味着产品迭代不再以资本耐心为限——这对动辄三年一代的芯片研发周期,是决定性的正循环。

五、命名之辨:思元系列与市场传闻的"690"​

最后回到一个细节:市场上热议的"690",官方从未正式发布命名。本站芯片卡以"思元690"收录其规格(已量产口径),而路透报道中的"690"实为市场对下一代芯片的暂称,寒武纪对具体命名、规格与定价均保持谨慎,一切以官方公告为准。这种"市场抢跑、官方缄默"的组合本身就是一个信号:在供给稀缺的卖方市场里,厂商不再需要靠预热造势——把名字留到正式发布,反而是一种定价权。

小结​

思元690 代表的"寒武纪时刻",本质上是三件事同时发生:技术上,700+ TFLOPS FP16、196GB HBM3 与 256 卡超节点让国产训练卡首次形成完整的系统级方案;商业上,首次年度盈利证明了国产 AI 芯片可以自我造血;市场地位上,20%–30% 的重新定价宣告国产芯片开始掌握定价权。当然,考验依然存在:千卡以上训练的互联工程成熟度、NeuWare 与 CUDA 的生态差距、以及下一代芯片能否如期放量。但至少在 2026 年秋天,国产 AI 芯片第一次同时拥有了技术、利润与议价能力。