阿里平头哥 真武 V900
产品概述
真武 V900 是阿里巴巴旗下 平头哥半导体 于 2026 年 9 月 22 日杭州云栖大会 正式发布的新一代训推一体 AI 芯片,官方称之为目前算力性能最强的中国自研 AI 芯片,可满足万亿级参数大模型的训练和推理需求。较原路线图(2027 年 Q3)明显提前,计划 2027 年第一季度量产上云。
V900 基于自研并行计算架构设计,搭载 216 GB 大容量显存(超过 NVIDIA B200 的 192 GB 与 H200 的 141 GB),片间互联带宽达 1200 GB/s(较 M890 的 800 GB/s 提升 50%)。芯片原生支持 FP8、FP4 低精度计算,官方称在大幅提升算力密度的同时显著降低推理成本,可应用于高精度训练、低精度和超低精度推理的全场景。
性能口径:官方称 V900 性能为真武 M890 的 3 倍,但与 M890 一致,平头哥未公开绝对 FLOPS 数值、制程节点与 TDP——业界普遍认为这与出口管制下的信息披露策略有关。业界推测 V900 由中芯国际制造(约 7nm 级工艺),但官方未证实。
互联与集群:基于自研 ICN 互联总线协议,V900 可通过 ICN Switch 芯片实现 Scale-Up 域内带宽完全对称的全互联架构,域内互联原生支持内存语义与内存统一编址,芯片间时延一致。内置真武 V900、ICN Switch、磐脉智能网卡及镇岳 SSD 主控芯片的磐久 AL128 超节点服务器实现算、存、网全栈协同,单一集群可扩展至 50 万卡规模,将于 2027 年第一季度上线。
商业化进展:基于真武 M890 的阿里云灵骏真武 M890 超节点实例 GP9A 已于 2026 年 8 月正式上线,是国内首个成功运行超 2 万亿参数大模型(千问 3.8、Kimi K3)的超节点形态算力。截至 2026 年 9 月,真武系列芯片已服务超 650 家企业客户,覆盖智驾、金融、基模、具身智能、能源、制造等行业。
核心规格
| 项目 | 参数 |
|---|---|
| 架构 | 平头哥自研并行计算架构(PPU) |
| 制程 | 未公开(业界推测国产 7nm 级) |
| 显存容量 | 216 GB |
| 片间互联带宽 | 1200 GB/s(自研 ICN 链路) |
| 精度支持 | FP32 / FP16 / FP8 / FP4 原生 |
| FP16 | 未公开 |
| TDP | 未公开 |
| 互联芯片 | ICN Switch(域内全对称全互联,内存统一编址) |
| 最大集群规模 | 50 万卡(磐久 AL128 超节点) |
| 发布 | 2026 年 9 月 22 日(2026 杭州云栖大会) |
| 量产上市 | 2027 年第一季度 |
| 软件栈 | T-Head SAIL(自研全栈) |
| 价格 | 未公开(主要随阿里云算力服务提供) |
⚠️ 规格说明:平头哥未公开 V900 的绝对 FLOPS 官方值、显存类型细节、制程节点与 TDP。上表「性能为 M890 的 3 倍」为厂商标称口径,缺乏独立第三方验证;独立基准测试最早需等 2027 年 Q1 量产后。
真武系列路线图
| 时间 | 型号 | 显存 | 片间互联 | 性能 |
|---|---|---|---|---|
| 2026 Q2 | 真武 810E | 96 GB HBM2e | 700 GB/s | 基线(第一代) |
| 2026 Q2 | 真武 M890 | 144 GB | 800 GB/s | 810E 的 3 倍 |
| 2027 Q1 | 真武 V900 | 216 GB | 1200 GB/s | M890 的 3 倍 |
| 2027 Q3 | 真武 J900 | 未公开 | 未公开 | 架构突破性创新 |
定位与竞争
真武 V900 是平头哥非对称竞争策略的集中体现:不与最先进制程硬碰硬,而是把显存容量、片间互联、软件栈和模型需求全栈打通。216 GB 显存直指大模型时代的「内存墙」——更大参数规模可直接加载进单卡,减少显存与内存间的数据搬运;1200 GB/s 片间互联对标 NVIDIA NVLink 量级,拆解万卡集群的「通信墙」。
在下游,阿里宣布通义千问将第一时间部署到 V900 集群,Qwen 下一代模型参数规模规划达数万亿至十万亿级,V900 及 50 万卡集群正是为这一目标预置的算力底座。V900 也被视为被出口管制挡在 NVIDIA B200 门外的中国云厂商最现实的高端训练选项之一。
主要限制:
- 绝对算力、制程、显存带宽等关键参数均未公开,实际性能待 2027 年量产后验证
- 软件生态(T-Head SAIL)仍落后 NVIDIA CUDA
- 高度绑定阿里云与通义千问体系,第三方部署灵活性有限