光进铜退:NPO/CPO 光互连如何重塑超节点架构
当超节点从 72 卡扩张到 4096 卡,铜缆互连在功耗与距离面前彻底缴械。2026 年 9 月,华为发布全球首个采用 NPO(近封装光学)技术的超节点,用 5500 个光引擎替代 4.8 万颗 800G 光模块、省电 550kW——"光进铜退"从口号变成了工程现实。
可插拔光模块的功耗天花板
传统数据中心组网依赖可插拔光模块:交换机面板上插着 400G、800G 的模块,通过光纤连接各节点。这套体系成熟、可维护,但在 AI 超节点规模下撞上了天花板。
华为披露的数字最具说服力:若用传统方案支撑昇腾 960 超节点的组网需求,需要约 48000 颗 800G 光模块。每颗 800G 可插拔模块功耗约 15-25W,4.8 万颗意味着仅光互连部分就要消耗兆瓦级电力,还不算 SerDes 链路、面板空间与故障率代价。更进一步,可插拔模块的 DSP 重定时环节占据了模块功耗的大头,且离交换芯片越远、信号损耗越大——模块越密,这场"功耗税"越重。
对于动辄数千卡、训练十万亿参数模型的超节点而言,光互连的功耗与可靠性直接决定了系统能建多大。这就是"光进铜退"的起点:把光引擎从面板挪到芯片身边,甚至塞进封装里面。
NPO、CPO、OIO:光互连技术梯队
按光引擎与芯片的距离由远及近,光互连分为三个梯队:
| 技术方案 | 光引擎位置 | 功耗收益 | 工程成熟度 | 代表 |
|---|---|---|---|---|
| 可插拔光模块 | 交换机面板 | 基线 | 成熟,生态完整 | 传统数据中心组网 |
| NPO 近封装光学 | 封装旁的基板上 | 显著降低,光源独立可换 | 已量产 | 昇腾 960 超节点 Hi-ONE |
| CPO 共封装光学 | 与交换芯片同封装 | 最大幅度降低 | 可靠性/可维护性待解 | 各厂商交换机路线图 |
| OIO 光 IO | 进入 GPU/芯片封装内部 | 终极形态 | 研究与早期验证 | 下一代超节点探索 |
NPO 与 CPO 的核心差异在于取舍:CPO 把光引擎与芯片放在同一封装,光电距离最短、功耗最低,但激光器故障要更换整个昂贵封装,可靠性与可制造性一直是拦路虎;NPO 则把光引擎放在封装之外的基板上,保留"独立可插换"的维护性,同时实现光电近距离握手。华为明确解释过为何 960 超节点选择 NPO 而非 CPO:规避 CPO 的可靠性、可制造性、可维护性难题,并延续现有光模块产业生态——这是工程务实主义的典型选择。OIO 则更激进,目标是把光 IO 直接做进 GPU 封装,与 HBM、die 一起共封装,被视为超节点互连的远期方向。
华为 Hi-ONE 案例精算:5500 引擎 vs 4.8 万模块
昇腾 960 超节点的 NPO 方案给出一组可以精算的对比:
| 指标 | 传统可插拔方案 | 昇腾 960 NPO 方案 |
|---|---|---|
| 光互连器件 | ~48000 颗 800G 光模块 | 5500 个 Hi-ONE 光引擎 |
| 单器件容量 | 800G | 7.2T(单引擎) |
| 功耗 | 基线 | 降低超 550 kW |
| 无故障运行时间 | 基线 | 提升一倍 |
| 整体可用度 | — | 99.8% |
三个要点值得展开:
- 单引擎容量 7.2T:一颗 Hi-ONE 顶 9 颗 800G 模块,器件数量骤降一个数量级,故障点随之大幅减少——这是无故障运行时间翻倍的直接来源;
- 省 550kW 意味着什么:550kW 约等于把整个 Vera Rubin NVL72 机柜(约 180kW TDP)的耗电省出近三台,省下的不仅是电费,更是散热系统的建设成本;
- 唯一内置光源:Hi-ONE 是业界首个量产、当前传输能力最大且唯一内置光源的 NPO 产品,内置光源意味着激光器与引擎协同设计,省去外置光源的耦合损耗。
配合灵衢 UnifiedBus 全域 D2D 互连(RTT 2μs),这套光互连底座支撑起单节点 4096 卡、8 EFLOPS FP8、1PB HBM 的超节点规模。
光互连对超节点规模的意义:72 卡到 4096 卡的物理前提
超节点的本质是让大量卡共享统一内存编址、像一台机器一样工作,而互连带宽与时延是规模的第一性约束。华为仿真数据:4K 超节点组成的 10 万卡集群,相比传统 8 卡服务器组网,MFU 提升 2.75 倍——因为在传统架构下,集群内通信占用训练时间超过 40%。
从 72 卡(NVL72 级别)到 4096 卡(昇腾 960 超节点),跨了两个数量级,物理上只有光互连能同时满足带宽密度、传输距离和功耗预算。NPO 把光链路推进到基板级,使跨机柜、跨机行的卡间通信时延降到微秒级,"逻辑上的一台机器"才有了物理载体。再往上,多个 960 超节点经灵衢网络或 RoCE 互联,最大可扩展到 51.2 万卡乃至 100 万卡集群——光互连是这一切的物理前提。
硅光、VCSEL、EML:技术路线与投资热
光互连的爆发也点燃了产业链与资本市场:
- EML 激光器:相干与高速光模块的核心光源,分析师口径显示 Lumentum 持有约 60% 的 EML 市场份额,是本轮"光进铜退"最直接的受益者之一;
- 硅光集成:把调制器、波导、探测器集成在硅片上,与 CMOS 工艺兼容,是 CPO/OIO 时代的主力路线;
- VCSEL 路线:Volantis 用类似 Face ID 的垂直腔面发射激光器连接 AI 芯片与内存芯片,主打短距、低成本,斩获 8800 万美元 A 轮融资;
- 加速器光互连创业潮:CScale 开发面向加速器的光互连技术,C 轮融资 1.45 亿美元;Upscale AI 推出多厂商芯片互联的 Token Fabric 平台,获 NVIDIA 参投(2026-10-08)。
从激光器材料、硅光工艺到系统级创业公司,资本正沿光互连链条全面下注——这与当年 HBM 军备竞赛的剧本如出一辙。
小结
光互连不再是数据中心的"锦上添花",而是超节点规模的"生死线"。可插拔光模块在 4.8 万颗的量级上暴露了功耗天花板,NPO 用 5500 个光引擎交出了省电 550kW、可用度 99.8% 的量产答卷,CPO 与 OIO 则代表着更彻底的光电融合。当卡间通信成为训练时间的大头,"光进铜退"就不再是技术偏好,而是算力扩张的唯一出路。