Helios 机架架构全解:72颗 MI455X、31TB HBM4、UALink 开放生态对垒 NVL72
当 AI 竞争的单元从单颗 GPU 升级为整个机架,机架架构就成了新的战场。AMD 的答案叫 Helios:72 颗 MI455X、18 颗 EPYC Venice、31TB HBM4,外加一条与 NVIDIA NVLink 完全不同的开放互联路线。本文拆解它的技术细节、工程约束与商业兑现节奏。
从 GPU 到机架:AI 基础设施的竞争单位变了
大模型训练与推理的规模已经远远超出单卡甚至单服务器的能力范围。万亿参数模型的训练需要数百到数千颗 GPU 高速协同,推理集群则要求在机架级完成模型分片与流量调度。于是 NVIDIA 用 NVLink 与 NVL72 把竞争拉到了机架层,而 AMD 在 2026 年 1 月的 CES 上给出了自己的回答——Helios,并在 Advancing AI 2026 上确认了完整规格。
Helios 的核心配置一目了然:
| 组件 | 配置 |
|---|---|
| GPU | 72 颗 MI455X(CDNA 5,每颗 432GB HBM4) |
| CPU | 18 颗 EPYC "Venice"(Zen 6,最高 256 核) |
| AI 网卡 | Pensando Vulcano 800G AI NIC |
| HBM4 总容量 | 31TB |
| FP4 推理算力 | 2.9 EFLOPS |
| FP8 训练算力 | 1.4 EFLOPS |
| 每 GPU 显存带宽 | 23.3TB/s |
| Scale-up 总带宽 | 260TB/s |
| Scale-out 带宽 | 43TB/s(较竞品多 50% 以上) |
单机架 2.9 EF FP4 的推理算力意味着,一个 Helios 机架可以完整运行 700B 级模型;31TB HBM4 则为超长上下文、多模态与 MoE 架构提供了充裕的显存池。
三级部件:MI455X、Venice 与 Vulcano
Helios 的性能来自三个部件的协同设计。
MI455X 是算力核心。每颗 GPU 基于 CDNA 5 架构,采用台积电 N2 计算芯粒加 N3P I/O 与缓存芯粒的混合封装,3200 亿晶体管,432GB HBM4 配 23.3TB/s 带宽,MXFP4 算力 40 PFLOPS 级。72 颗的规模使其成为目前单机架密度最高的 AI 算力方案之一。
EPYC Venice 是主机侧大脑。这款全球首款 2nm 数据中心 CPU 基于 Zen 6 架构,最高 256 核、1GB L3 缓存、16 通道内存提供 1.6TB/s 带宽,CPU 到 GPU 互联带宽是上一代的 2 倍。在 Helios 中,每托盘 4 颗 GPU 配 1 颗 Venice,18 颗 CPU 负责数据搬运、内存管理与系统调度。
Pensando Vulcano 是网络出口。800G AI NIC 负责 scale-out 侧的横向扩展,前代 Pollara 400G 已在 MI300 系列上验证了 AMD 网卡路线,Vulcano 将单卡带宽翻倍,并深度配合 UALink 协议栈。
UALink over Ethernet:开放互联路线的技术选择
Helios 最具战略意义的设计是互联方案:采用 UALink over Ethernet(UALoE)实现 scale-up 纵向扩展,单 GPU 纵向扩展带宽 3.6TB/s,横向扩展 600GB/s(由三块 800G Vulcano NIC 提供);整个机架的 scale-up 总带宽达 260TB/s,scale-out 达 43TB/s——后者比同级竞品高出 50% 以上。
UALink 是 AMD 联合 Broadcom、Intel 等共同推动的开放标准,目标是打破 NVLink 的封闭生态。选择"UALink 跑在以太网上"而非另起炉灶的专有协议,有三层考量:
- 生态复用:数据中心以太网的技术栈、运维体系与供应链已经高度成熟,复用以太网物理层可以大幅降低部署门槛。
- 供应商多元:开放标准意味着交换芯片、网卡、线缆可以有多个供应商,客户不再被单一家族的网络产品绑定。
- 与 OCP 协同:UALink 与 OCP 的机架规范天然衔接,形成从芯片到机柜的完整开放栈。
与之对照,NVIDIA 的 NVLink 路线追求极致的私有优化——每 GPU 互联带宽更高、协议延迟更低,但代价是生态锁定。两条路线的胜负,取决于开放生态的成熟速度能否追上垂直整合的性能优势。
44OU ORW 机架:被物理约束塑造的工程设计
Hot Chips 2026 上披露的机架工程细节,展示了巨型 AI 系统在数据中心物理约束下的真实样子。
| 工程维度 | Helios 机架参数 |
|---|---|
| 机柜规格 | 44OU ORW 双宽机架(Open Rack Wide v3) |
| 托盘布局 | 18 个计算托盘 + 6 个交换托盘 |
| 散热 | 全液冷 + 液冷快速接头 |
| 供电 | 50V 直流母线 |
| 整机重量 | 超过 7000 磅 |
这组数字背后是严酷的物理现实。72 颗高功耗 GPU 加 18 颗 CPU 使机架功率达到 225-245kW,传统风冷在如此功率密度下已经无能为力,全液冷成为唯一选项,液冷快速接头则是为了支持托盘级热插拔维护——在价值 500 万美元以上的机架中,停机时间就是真金白银。
50V 直流母线的选择同样有讲究:相比传统交流配电,直流母线减少一次 AC-DC 转换损耗,且在高功率密度下配电铜排更省空间。而超过 7000 磅的整机重量,则意味着数据中心的地板承重、搬运路线乃至建筑结构都需要为此重新评估——这也是它与 Meta 共研 ORW(Open Rack Wide)设计的意义:让宽体机架成为行业可复用的开放标准,而不是每家云厂商各造一套。
量产节奏与客户版图
Helios 的交付节奏已经进入兑现期:2026 年 7 月开始量产,Q3 末首批出货,Q4 放量。客户侧的版图同样清晰:
- 微软:2026 年 7 月宣布扩大合作,在 Azure 大规模部署 Helios 机架级系统,明确用于前沿模型推理而非训练。
- Oracle:被列为 Helios 早期采用者。
- OpenAI:6GW 级合作协议,首批 1GW 基于 MI450 系列,计划 2026 年 Q4 启动 Helios 规模化上架,2027 年进入加速投放周期。
- Meta:最多 6GW 的 AMD GPU 部署计划,正测试 Helios 机架与第六代 EPYC,并与 AMD 共研基于 MI450 架构的定制加速器。
- TCS:将 Helios 带到印度市场。
- HPE:开放机架合作,加入 Dell、Supermicro、Lenovo 的 OEM 阵容。
- 主权 AI:Helios 平台也将助力美国主权 AI 工厂超算建设。
OpenAI 与 Meta 合计 12GW 以上的合作规模,是检验 Helios 商业模式的试金石。AMD 用认股权证与战略投资绑定头部客户的模式(如向 OpenAI 发行最多 1.6 亿股认股权证),本质是把未来收入与客户增长深度绑定——如果兑现,AMD 将在 AI 加速器市场获得实质性的第二供应商地位。
小结
Helios 不只是一台更大的机柜,而是 AMD 对 AI 基础设施的一次完整表态:用 UALink 与 OCP 的开放标准对抗 NVLink 的垂直整合,用显存容量与 scale-out 带宽的数字优势切入推理市场,用与 Meta 共研的 ORW 机架设计把工程经验沉淀为行业规范。7000 磅的重量、50V 直流母线与全液冷快速接头提醒我们,AI 竞争已经深入到供电、散热与承重这样的物理细节。接下来真正的问题只有一个:6GW 订单的兑现节奏,能否跟上纸面参数的漂亮程度。