寒武纪 MLU690 深度解析:700+ TFLOPS FP16 与国产训练卡的寒武纪时刻
在华为昇腾与英伟达的双雄叙事之外,寒武纪正在写下国产 AI 芯片的第三条故事线:思元690 以 700+ TFLOPS FP16 登顶国产纸面算力,公司实现首次年度盈利,下一代芯片未发先涨 20%–30%。这个曾经靠情怀撑估值的"AI 芯片第一股",第一次同时握住了技术、商业与定价权三张牌。
一、思元690 核心规格:196GB HBM3 撑起的算力天花板
按本站芯片卡收录的规格,思元690(MLU690)采用双 die Chiplet 封装,2026 年初量产,核心参数如下:
| 项目 | 参数 |
|---|---|
| 架构 | 新一代 MLUarch 架构 |
| 制程 | 中芯国际 N+2(5nm 级),亦见台积电 4nm 双 die 报道 |
| 显存 | 196 GB HBM3 |
| 显存带宽 | 3.35 TB/s |
| FP16/BF16 | 700+ TFLOPS |
| INT4 | 2800+ TOPS |
| 互联 | MLU-Link 890 Gbps/卡 |
| TDP | 400–500 W |
| 单价 | ¥14–15 万 |
与上代思元590 相比,这是一次全面换代;与 H100 相比,则是典型的"错位竞争":
| 指标 | 思元690 | 思元590 | H100 SXM | 对比 H100 |
|---|---|---|---|---|
| 显存 | 196GB HBM3 | 96GB HBM2e | 80GB HBM3 | 2.45× |
| 显存带宽 | 3.35 TB/s | ~2 TB/s | 3.35 TB/s | 持平 |
| FP16 | 700+ TFLOPS | 345 TFLOPS | 989 TFLOPS | ~71% |
| INT8 推理 | 反超(INT4 2800+ TOPS 口径) | 1380 TOPS | 1979 TOPS | 部分场景反超 |
196GB 显存是思元690 最锋利的差异化武器:单卡装下更大的模型与 KV Cache,在推理场景性价比突出;纯推理场景可达到 H100 的 80%–90%。短板同样清晰——FP16 训练算力与千卡以上分布式训练的互联工程成熟度。为此,WAIC 2026 上寒武纪同步落地了 256 卡规模超节点集群方案,已在多地智算中心部署,从"单卡算力"走向"系统级算力"。
二、架构演进:MLUarch 换代与 HBM3 上量
思元690 的代际跃迁体现在三处:其一,MLUarch 架构换代(市场披露口径称新一代芯片采用 MLUarch 04),配合双 die Chiplet 封装,把晶体管预算投向张量算力与显存通道;其二,显存从 HBM2e 一举上量到 196GB HBM3,3.35 TB/s 带宽与 H100 持平——在国产供应链里率先解决"内存墙";其三,MLU-Link 890 Gbps 卡间互联已接近 NVLink 4 的 900 GB/s 量级,为 256 卡超节点铺路。软件侧的 NeuWare 是国内少有的云边端统一栈:PyTorch/TensorFlow 适配版、NeuBLAS、NeuDNN,以及全球首批商用 MLIR 图编译推理框架 MagicMind。
供应链上,台积电因实体清单停供后,寒武纪全线转向中芯国际 N+2,成为中芯先进制程的最大客户之一;N+2 产能已锁定至 2027 年。
三、涨价 20%–30%:国产芯片第一次掌握定价权
路透社 2026 年 9 月 10 日报道:寒武纪下一代芯片(市场暂称"690")重新定价,较两个月前上涨 20%–30%。同期昇腾 950DT 报价突破 25 万元、沐曦、天数智芯等国产卡也集体上调 20%–30%——这不是寒武纪一家的孤例,而是 HBM 成本飙升叠加供不应求下的全行业现象。
值得注意的是官方态度:寒武纪董秘办回应"不要听信市场消息,一切以官方公告为准"。渠道价与官方定价之间存在明显温差——涨价是市场现实,但公司不愿为渠道炒作背书。这背后是国产 AI 芯片定价权的历史性变化:过去国产卡必须以"替代品折价"换取订单,如今供给稀缺让定价逻辑转向"稀缺溢价"。在华为、寒武纪、摩尔线程构成的国产三强格局中,寒武纪第一次拥有了"不降价也能卖动"的底气。
四、首次年度盈利:商业模式的拐点
如果说涨价反映的是市场热度,盈利则验证了商业模式的成色。按 2026 年上半年行业复盘口径,寒武纪已实现首次年度盈利。配套数据同样亮眼:2026 年 Q1 营收 28.85 亿元,同比增长 160%;2026 年 6 月市值突破万亿元。客户结构上,字节跳动是最大客户(思元580/590/690 合计采购超 50 万颗,约占其采购的 65%),阿里、百度、中国移动相继进入订单名单。
"首次盈利"对国产 AI 芯片行业的标志意义在于:这个赛道第一次出现了不依赖补贴与融资、靠卖芯片本身赚钱的商业模式。研发投入可以自我造血,意味着产品迭代不再以资本耐心为限——这对动辄三年一代的芯片研发周期,是决定性的正循环。
五、命名之辨:思元系列与市场传闻的"690"
最后回到一个细节:市场上热议的"690",官方从未正式发布命名。本站芯片卡以"思元690"收录其规格(已量产口径),而路透报道中的"690"实为市场对下一代芯片的暂称,寒武纪对具体命名、规格与定价均保持谨慎,一切以官方公告为准。这种"市场抢跑、官方缄默"的组合本身就是一个信号:在供给稀缺的卖方市场里,厂商不再需要靠预热造势——把名字留到正式发布,反而是一种定价权。
小结
思元690 代表的"寒武纪时刻",本质上是三件事同时发生:技术上,700+ TFLOPS FP16、196GB HBM3 与 256 卡超节点让国产训练卡首次形成完整的系统级方案;商业上,首次年度盈利证明了国产 AI 芯片可以自我造血;市场地位上,20%–30% 的重新定价宣告国产芯片开始掌握定价权。当然,考验依然存在:千卡以上训练的互联工程成熟度、NeuWare 与 CUDA 的生态差距、以及下一代芯片能否如期放量。但至少在 2026 年秋天,国产 AI 芯片第一次同时拥有了技术、利润与议价能力。