跳到主要内容

阿里平头哥 真武 V900

产品概述​

真武 V900 是阿里巴巴旗下 平头哥半导体 于 2026 年 9 月 22 日杭州云栖大会 正式发布的新一代训推一体 AI 芯片,官方称之为目前算力性能最强的中国自研 AI 芯片,可满足万亿级参数大模型的训练和推理需求。较原路线图(2027 年 Q3)明显提前,计划 2027 年第一季度量产上云。

V900 基于自研并行计算架构设计,搭载 216 GB 大容量显存(超过 NVIDIA B200 的 192 GB 与 H200 的 141 GB),片间互联带宽达 1200 GB/s(较 M890 的 800 GB/s 提升 50%)。芯片原生支持 FP8、FP4 低精度计算,官方称在大幅提升算力密度的同时显著降低推理成本,可应用于高精度训练、低精度和超低精度推理的全场景。

性能口径:官方称 V900 性能为真武 M890 的 3 倍,但与 M890 一致,平头哥未公开绝对 FLOPS 数值、制程节点与 TDP——业界普遍认为这与出口管制下的信息披露策略有关。业界推测 V900 由中芯国际制造(约 7nm 级工艺),但官方未证实。

互联与集群:基于自研 ICN 互联总线协议,V900 可通过 ICN Switch 芯片实现 Scale-Up 域内带宽完全对称的全互联架构,域内互联原生支持内存语义与内存统一编址,芯片间时延一致。内置真武 V900、ICN Switch、磐脉智能网卡及镇岳 SSD 主控芯片的磐久 AL128 超节点服务器实现算、存、网全栈协同,单一集群可扩展至 50 万卡规模,将于 2027 年第一季度上线。

商业化进展:基于真武 M890 的阿里云灵骏真武 M890 超节点实例 GP9A 已于 2026 年 8 月正式上线,是国内首个成功运行超 2 万亿参数大模型(千问 3.8、Kimi K3)的超节点形态算力。截至 2026 年 9 月,真武系列芯片已服务超 650 家企业客户,覆盖智驾、金融、基模、具身智能、能源、制造等行业。

核心规格​

项目参数
架构平头哥自研并行计算架构(PPU)
制程未公开(业界推测国产 7nm 级)
显存容量216 GB
片间互联带宽1200 GB/s(自研 ICN 链路)
精度支持FP32 / FP16 / FP8 / FP4 原生
FP16未公开
TDP未公开
互联芯片ICN Switch(域内全对称全互联,内存统一编址)
最大集群规模50 万卡(磐久 AL128 超节点)
发布2026 年 9 月 22 日(2026 杭州云栖大会)
量产上市2027 年第一季度
软件栈T-Head SAIL(自研全栈)
价格未公开(主要随阿里云算力服务提供)

⚠️ 规格说明:平头哥未公开 V900 的绝对 FLOPS 官方值、显存类型细节、制程节点与 TDP。上表「性能为 M890 的 3 倍」为厂商标称口径,缺乏独立第三方验证;独立基准测试最早需等 2027 年 Q1 量产后。

真武系列路线图​

时间型号显存片间互联性能
2026 Q2真武 810E96 GB HBM2e700 GB/s基线(第一代)
2026 Q2真武 M890144 GB800 GB/s810E 的 3 倍
2027 Q1真武 V900216 GB1200 GB/sM890 的 3 倍
2027 Q3真武 J900未公开未公开架构突破性创新

定位与竞争​

真武 V900 是平头哥非对称竞争策略的集中体现:不与最先进制程硬碰硬,而是把显存容量、片间互联、软件栈和模型需求全栈打通。216 GB 显存直指大模型时代的「内存墙」——更大参数规模可直接加载进单卡,减少显存与内存间的数据搬运;1200 GB/s 片间互联对标 NVIDIA NVLink 量级,拆解万卡集群的「通信墙」。

在下游,阿里宣布通义千问将第一时间部署到 V900 集群,Qwen 下一代模型参数规模规划达数万亿至十万亿级,V900 及 50 万卡集群正是为这一目标预置的算力底座。V900 也被视为被出口管制挡在 NVIDIA B200 门外的中国云厂商最现实的高端训练选项之一。

主要限制:

  • 绝对算力、制程、显存带宽等关键参数均未公开,实际性能待 2027 年量产后验证
  • 软件生态(T-Head SAIL)仍落后 NVIDIA CUDA
  • 高度绑定阿里云与通义千问体系,第三方部署灵活性有限