Skip to main content

30 posts tagged with "AI Infrastructure"

Data center, power and networking infrastructure for AI

View all tags

Agentic AI 正在重塑基础设施:从 token 到沙盒的新算力经济学

· 5 min read
Industry Research Team

聊天机器人时代,衡量算力的单位是 FLOPS 和 token/s。2026 年,随着企业 Agent 从"回答问题"转向"完成任务",一种新的计量单位开始流行——沙盒/秒。基础设施的每个环节,正在被这种新工作负载重新定价。

Agent 工作负载的"三高"​

Agent 与传统推理的本质区别在于它不是一次请求、一次回答,而是一个持续数十步的执行循环:每一步都要启动工具、运行代码、读写环境、反思结果。这给基础设施带来"三高"压力。

第一,高并发沙盒。Agent 执行任务需要隔离的代码执行环境,Daytona 在 2026 年 10 月 10 日发布的智能体基准显示:在 8×EPYC 9755 服务器上,基于 Vera CPU 的方案 10.8 秒即可上线 1000 个沙盒,峰值达 13.3 任务/秒,扩展到 2000 沙盒耗时 27.4 秒——沙盒的创建延迟,正在成为 Agent 平台的核心 SLO。第二,高频短请求。一个任务循环里包含大量短小的模型调用(工具选择、结果解析、路由判断),这类请求的 prefill 远大于 decode,与聊天场景的负载曲线完全不同。第三,大 KV Cache。Agent 会话动辄数十万 token,NVIDIA RTX Spark 甚至把 100 万 token 上下文作为桌面级卖点,长会话的 KV Cache 成了显存的最大消耗者。

机构口径显示,AI 推理的 token 消耗已达人类用户直接使用量的约 5 倍——机器与机器之间的对话,正在取代人与人之间的对话,成为算力的主要买家。

算力计量单位的变迁​

时代计量单位代表指标采购逻辑
训练为王FLOPS峰值算力比参数表
推理规模化token/s吞吐与延迟比单位 token 成本
Agent 时代沙盒/秒、任务/秒环境创建延迟、任务完成率比任务执行成本

这个变迁的深层含义是:采购决策从"买算力"变成"买任务完成能力"。Meta 的 Hatch 以每月 199.99 美元的价格出售自主 Agent(接入 DoorDash、Etsy、Reddit、Outlook),Google Cloud 的 Gemini 企业 Agent 强调"做工作而非答题",OpenAI 的 Presence 企业 Agent 进入有限 GA——定价单位都是"订阅/任务",倒推回基础设施层,就是沙盒密度与任务吞吐。

decode 阶段专用硬件的兴起​

Agent 循环里最伤延迟的不是 prefill,而是 decode——每一步的生成速度直接决定用户等待时间。NVIDIA 在 Vera Rubin 平台的七芯片堆栈里塞进了一颗非典型成员:Groq 3 LPX,定位是"专为智能体解码阶段设计的低延迟推理加速器"。这是 NVIDIA 第一次在旗舰平台里为 decode 单独配一颗 ASIC,与 Rubin GPU(管 prefill 和训练)形成分工。

逻辑不难理解:prefill 是算力受限,GPU 的 FLOPS 越多越好;decode 是带宽与延迟受限,堆 FLOPS 无济于事,需要的是针对逐 token 生成的访存优化。当 Agent 流量的 decode 占比持续上升,专用 decode 硬件就有了独立存在的经济学基础——正如当年推理从训练中拆分出来催生了推理 ASIC 一样,decode 正在从推理中再拆分出来。

上下文内存成为新基建​

Agent 的长会话必须能"暂停、保存、恢复"——用户中午发起的任务,Agent 下午继续执行时,几十万 token 的上下文不能重算。这催生了一层新基础设施:上下文内存。NVIDIA 把 BlueField-4 DPU 升级为推理上下文内存存储平台,宣称 token 吞吐最高提升 5 倍;华为同步发布 OceanStor M900 上下文内存存储集群,通过灵衢总线一跳直连,为昇腾超节点提供 PB 级 KV Cache,并把 SSD 读写寿命延长 16 倍。

Vera CPU 的高密度机架同样服务于这个趋势:单机架最大 256 颗 Vera CPU、支持同时运行超过 2.25 万个并发环境——CPU 不再只是 GPU 的陪衬,而是沙盒编排与上下文管理的专职引擎。

企业级门槛与采购建议​

Agent 进入企业还多了一层合规门槛:agent 身份(每个 Agent 是谁、权限多大)、操作日志(每一步做了什么)、回滚能力(出错如何撤销)。这些要求把"执行层"变成了强粘性资产——模型可以随时换,但嵌入业务流程的执行层一旦部署就很难被替换。这也解释了为什么企业 Agent 的竞争焦点从"回答质量"迅速转向"任务完成"。

给采购与架构师三条建议:第一,评估 Agent 平台时先看沙盒指标——创建延迟、并发密度、任务/秒,而不是 GPU 型号;第二,规划推理集群时预留上下文存储层,BlueField-4 类平台和 PB 级 KV 存储应当进采购清单;第三,关注 decode 专用硬件的落地节奏,LPX 这类组件可能重新划分推理服务器的内部配比。

小结​

Agentic AI 把算力经济学从"每 token 多少钱"推进到"每任务多少钱":高并发沙盒要求 CPU 密度,高频短请求要求 decode 专用硬件(Groq 3 LPX 是第一个信号),大 KV Cache 要求 PB 级上下文内存基建。Daytona 基准里 10.8 秒上线 1000 沙盒的成绩单,预示着"沙盒/秒"将成为下一轮基础设施比拼的通用语言。谁能把执行层做深、把上下文存好、把 decode 做快,谁就握住了 Agent 时代的入口。

5000亿美元涌向 AI 财团:这轮融资狂潮与2000年有何不同

· 6 min read
Industry Research Team

高盛的最新统计显示,今年至今投资者已向 AI 财团提供约 5000 亿美元融资,且云服务商的债务发行已经扩展到欧元、加元等多个市场。NVIDIA 投资 OpenAI、博通为 OpenAI 筹债、SpaceX 借钱买卡——供应商与客户之间的资金循环越来越复杂。这轮融资狂潮与 2000 年电信泡沫究竟有何异同?

5000 亿美元:融资全景​

据高盛(2026 年 10 月 10 日 AIGC 早报口径)统计,今年至今投资者已向 AI 财团提供约 5000 亿美元融资。更值得注意的是债务发行的货币多元化:云服务商已把债务发行从美元市场扩展到欧元、加元等市场,这说明融资需求大到单一市场难以承接,也说明全球固定收益投资者正在系统性接纳 AI 基础设施作为资产类别。

融资案例:钱从哪来,流向哪去​

主体交易结构金额
GMI Cloud(GPU 云)NVIDIA 参与的 2.23 亿美元股权 + 台湾中国信托商业银行领投 4.45 亿美元信贷6.68 亿美元
Firmus(AI 基础设施)IPO,约 50% 股份分配给现有持有人投资者需求超发行规模,澳洲最大 IPO 之一
博通 → OpenAI为定制芯片筹资(早期约 300 亿美元债务磋商)超 500 亿美元
SpaceX → NVIDIAApollo 牵头:100 亿美元银行贷款 + 300 亿美元投资级债务400 亿美元
亚马逊售后回租十余座数据中心 Grace Blackwell 芯片,另拟向投资者转让约 80 亿美元芯片资产盘活
NVIDIA → OpenAI非控股股权投资 + 10GW 算力承诺1000 亿美元

几个案例值得展开。GMI Cloud 的结构是典型的"股债混合":GPU 云公司同时拿到 NVIDIA 的股权背书和商业银行的信贷支持,NVIDIA 参股本身就成了债务融资的信用增强。Firmus 的 IPO 则展示了需求端的疯狂——投资者需求超过发行规模,以至于约 50% 的股份直接分配给现有持有人,成为澳洲最大 IPO 之一。SpaceX 的 400 亿美元融资完全用于购买 NVIDIA 芯片,由 Apollo 牵头,拆成 100 亿美元银行贷款加 300 亿美元投资级债务——一家航天公司为买芯片发行投资级债券,这在三年前不可想象。

循环交易结构图解​

把这些交易连起来看,会形成一个闭环:

NVIDIA ──1000亿投资──→ OpenAI
↑ │
│ 采购芯片 │ 定制芯片订单
│ ↓
SpaceX/云厂商 ←──博通筹资500亿(债务)
│ │
│ 抵押/回租芯片 │ 债务发行
↓ ↓
银行/私募信贷/公开市场投资者(5000亿总量)

循环的每一环都合理:NVIDIA 投资客户以锁定采购(1000 亿美元对应 10GW 承诺);博通靠 OpenAI 定制芯片订单筹资扩产;SpaceX、GPU 云用债务买卡再靠租金还本付息;亚马逊用售后回租把沉淀在数据中心的芯片资产盘活成现金流。但闭环的风险也在于此——每一方的偿付能力都依赖于循环不中断。一旦 GPU 租金价格下行或 AI 收入不及预期,链条上最脆弱的一环会传导给所有人。

与 2000 年电信光纤泡沫的异同​

维度2000 年电信光纤泡沫2026 年 AI 财团融资
底层资产暗光纤(长期过剩)GPU 算力(当前供不应求)
收入基础收入证明缓慢有真实收入(推理需求真实增长)
融资主导股权 + 高收益债债务主导(银行贷款 + 投资级债)
集中度多家电信运营商分散集中度更高(少数财团互为交易对手)
资产贬值速度光纤几乎不贬值GPU 一年一代,贬值快

相同点是"基建先行、收入后置"的赌注结构,以及供应商给自己客户输血的循环感。不同点同样关键:本轮有真实收入——推理需求是实实在在的付费市场,这与当年"建好光纤等流量"的空想不同;但本轮集中度更高,少数几个财团互为最大客户和最大债权人,系统性关联风险远超当年。更麻烦的是债务主导:2000 年泡沫破裂主要由股东承担损失,而本轮大量融资是投资级债务和银行贷款,一旦违约将直接冲击信贷市场。

风险监测清单​

华尔街正把 AI 数据中心投资打包为公开市场产品——在政治与建设风险上升的背景下,普通投资者也将被卷入这个循环。以下是一份风险监测清单:

  1. GPU 租赁价格曲线:租金下行是循环断裂的第一信号;
  2. 债务展期条件:关注博通、SpaceX 类大额融资的再融资成本变化;
  3. 供应商应收账款质量:NVIDIA 对客户的投资与销售绑定,收入质量需打折扣看待;
  4. 资产证券化进度:芯片回租、资产转让产品化的规模与折价率;
  5. 政策风险:出口管制变化对跨境算力租赁结构的影响;
  6. 电力与建设进度:数据中心延期交付直接冲击按产能定价的债务模型。

小结​

5000 亿美元的 AI 财团融资规模已经超过多数国家级基建预算,其结构特征是债务主导、循环交易和高度集中。与 2000 年相比,本轮有真实收入支撑,这与光纤泡沫有本质区别;但集中度更高、债务占比更大、资产贬值更快,三点决定了风险一旦暴露会传导得更快。循环交易本身不是原罪——产业链上下游互相投资在重资产行业并不罕见——但它放大了周期。对参与者和观察者而言,重点不是预测泡沫何时破裂,而是盯住租金价格、债务展期和资产证券化折价这三个先行指标。

算力资产金融化:芯片回租、GPU 抵押与"卡本位"融资

· 6 min read
Industry Research Team

当亚马逊把十余座数据中心的 Grace Blackwell 芯片售后回租、GMI Cloud 拿到 4.45 亿美元银行信贷、腾讯通过 Oracle 租用 10 万颗芯片时,GPU 已经不只是计算设备,而是一种可融资、可抵押、可证券化的金融资产。"卡本位"融资正在重塑 AI 行业的资产负债表。

芯片成为金融资产的三种形态​

传统观念里,服务器芯片是快速贬值的 IT 设备,进入资产负债表后只会计提折旧。2026 年的资本市场上,算力资产正在以三种形态被金融化:

形态代表案例资金方商业逻辑
售后回租亚马逊十余座数据中心 Grace Blackwell 芯片租赁/投资机构出让资产 + 长期租回,释放基建现金流
抵押信贷GMI Cloud 4.45 亿美元银行信贷(台湾中国信托商业银行领投)商业银行GPU 抵押 + 合同现金流授信
租赁通道腾讯租用 Oracle 10 万颗芯片云厂商绕开出口管制的使用权采购

这三种形态的共同前提是:GPU 的租金现金流足够稳定,可以被当作信贷的还款来源。这正是 GPU 云行业与传统 IT 采购最本质的区别——芯片变成了会持续产生租金的收入型资产。

案例拆解:从回租到租赁通道​

亚马逊:售后回租与资产转让​

亚马逊正在推进两条并行的资产盘活路径:其一,对旗下十余座数据中心的 Grace Blackwell 高端芯片做售后回租——"出让资产 + 长期租回",用一次性回款缓解算力基建的现金流压力,代价是支付长期租金;其二,据 The Gist/FT 口径(2026 年 10 月 8 日),亚马逊另拟向投资者转让约 80 亿美元 NVIDIA 芯片资产。作为手握约 2200 亿美元 2026 年 capex 的最大买家,亚马逊把沉淀的芯片资产重新变成流动性,本质上是在为下一轮采购腾出资产负债表空间。

GMI Cloud:GPU 抵押信贷的样板​

GMI Cloud 的 6.68 亿美元融资拆成了两层:NVIDIA 参与的 2.23 亿美元股权,加上台湾中国信托商业银行领投的 4.45 亿美元信贷。银行愿意给一家 GPU 云公司放贷,看中的是其 GPU 资产和租赁合同现金流——NVIDIA 的股权参与又进一步增强了信用。这是"卡本位"信贷的完整样板:芯片做抵押物,租金做还款来源,厂商背书做信用增强。

腾讯:租赁通道与合规灰区​

腾讯租用 Oracle 10 万颗芯片的案例(2026 年 10 月 2 日 Slicast 报道)展示了第三种形态:不购买芯片所有权,而是采购算力使用权。这种模式被广泛解读为绕开出口管制的租赁安排——管制限制的是芯片出口,而云端算力的跨境租用处于监管的模糊地带。需要强调的是,这类结构的合规边界并不清晰,各国出口管制规则仍在动态调整,"租赁即合规"的假设存在政策风险。

SpaceX 与博通:债务买卡的资金源头​

SpaceX 拟以 400 亿美元融资购买 NVIDIA 芯片(Apollo 牵头:100 亿美元银行贷款 + 300 亿美元投资级债务);博通则为 OpenAI/Anthropic 的定制芯片安排数百亿美元债务。加上 NVIDIA 1000 亿美元投资 OpenAI,债务买卡的资金池已经大到足以改变芯片行业的商业模式——从"客户付钱买卡"变成"资本市场付钱买卡,客户用租金还钱"。

"卡本位"估值的关键假设​

把 GPU 当作可融资资产,估值模型建立在几个关键假设之上,而这些假设恰恰是最脆弱的环节:

假设一:残值率。 信贷方给 GPU 估值时必须假设芯片几年后的残余价值。传统服务器的残值模型在 GPU 上未必成立——B300 当前租金可达 9.50 美元/GPU 小时(Nebius 口径),但三年后的租金和残值高度不确定。

假设二:技术迭代贬值速度。 NVIDIA 已进入 Rubin 一年一代的节奏。当新一代芯片的性能/瓦优势足够大时,旧卡租金会加速下滑,残值假设被击穿,抵押物价值缩水会直接触发信贷条款重估。一年一代的迭代周期,本质上是在加速抵押品的贬值曲线——这是"卡本位"融资与房产抵押贷最根本的不同。

假设三:需求连续性。 租金现金流的稳定性依赖 AI 推理需求的持续增长。算力供给的大规模释放(各家 AI 工厂 2027-2028 年集中交付)可能改变供需平衡。

对 GPU 云创业公司资产负债表的重塑​

算力金融化对 GPU 云创业公司是双刃剑。好的一面:融资渠道从股权扩展到债务,GMI Cloud 证明了银行信贷可以成为股权之外的第二资金来源,创始人稀释更少、扩张更快。坏的一面:资产负债表上堆积了大量以 GPU 为抵押的债务,让本就重资产的模式更加脆弱——租金价格下行 20%,可能同时冲击收入端和抵押物估值端,形成双重挤压。

对比之下,Oracle、亚马逊等巨头通过回租和资产转让把风险向投资者转移,创业公司反而更依赖抵押信贷。融资结构的分化,将在下一轮周期波动中重新洗牌 GPU 云行业的座次。至于 Oracle 用燃气卡车运电维持数据中心运转所暴露的高运营成本,则提醒所有信贷方:GPU 资产的"持有成本"里,电费可能是比折旧更凶猛的现金流出。

小结​

算力资产金融化已经形成三种成熟形态:亚马逊式的售后回租释放现金流、GMI Cloud 式的抵押信贷打开债务融资渠道、腾讯式的租赁通道解决跨境采购。支撑"卡本位"估值的是残值率、贬值速度和需求连续性三大假设,而 Rubin 一年一代的迭代节奏正在持续考验第一和第二个假设。对 GPU 云创业公司而言,债务杠杆放大了扩张速度,也放大了周期风险;对信贷方而言,给会快速贬值的芯片做抵押,风控逻辑必须区别于传统资产。算力金融化让行业跑得更快,也让下一轮回调来得更有杠杆——这是所有参与者在享受低息资金红利时,必须同步想清楚的问题。

Helios 机架架构全解:72颗 MI455X、31TB HBM4、UALink 开放生态对垒 NVL72

· 7 min read
Industry Research Team

当 AI 竞争的单元从单颗 GPU 升级为整个机架,机架架构就成了新的战场。AMD 的答案叫 Helios:72 颗 MI455X、18 颗 EPYC Venice、31TB HBM4,外加一条与 NVIDIA NVLink 完全不同的开放互联路线。本文拆解它的技术细节、工程约束与商业兑现节奏。

从 GPU 到机架:AI 基础设施的竞争单位变了​

大模型训练与推理的规模已经远远超出单卡甚至单服务器的能力范围。万亿参数模型的训练需要数百到数千颗 GPU 高速协同,推理集群则要求在机架级完成模型分片与流量调度。于是 NVIDIA 用 NVLink 与 NVL72 把竞争拉到了机架层,而 AMD 在 2026 年 1 月的 CES 上给出了自己的回答——Helios,并在 Advancing AI 2026 上确认了完整规格。

Helios 的核心配置一目了然:

组件配置
GPU72 颗 MI455X(CDNA 5,每颗 432GB HBM4)
CPU18 颗 EPYC "Venice"(Zen 6,最高 256 核)
AI 网卡Pensando Vulcano 800G AI NIC
HBM4 总容量31TB
FP4 推理算力2.9 EFLOPS
FP8 训练算力1.4 EFLOPS
每 GPU 显存带宽23.3TB/s
Scale-up 总带宽260TB/s
Scale-out 带宽43TB/s(较竞品多 50% 以上)

单机架 2.9 EF FP4 的推理算力意味着,一个 Helios 机架可以完整运行 700B 级模型;31TB HBM4 则为超长上下文、多模态与 MoE 架构提供了充裕的显存池。

三级部件:MI455X、Venice 与 Vulcano​

Helios 的性能来自三个部件的协同设计。

MI455X 是算力核心。每颗 GPU 基于 CDNA 5 架构,采用台积电 N2 计算芯粒加 N3P I/O 与缓存芯粒的混合封装,3200 亿晶体管,432GB HBM4 配 23.3TB/s 带宽,MXFP4 算力 40 PFLOPS 级。72 颗的规模使其成为目前单机架密度最高的 AI 算力方案之一。

EPYC Venice 是主机侧大脑。这款全球首款 2nm 数据中心 CPU 基于 Zen 6 架构,最高 256 核、1GB L3 缓存、16 通道内存提供 1.6TB/s 带宽,CPU 到 GPU 互联带宽是上一代的 2 倍。在 Helios 中,每托盘 4 颗 GPU 配 1 颗 Venice,18 颗 CPU 负责数据搬运、内存管理与系统调度。

Pensando Vulcano 是网络出口。800G AI NIC 负责 scale-out 侧的横向扩展,前代 Pollara 400G 已在 MI300 系列上验证了 AMD 网卡路线,Vulcano 将单卡带宽翻倍,并深度配合 UALink 协议栈。

Helios 最具战略意义的设计是互联方案:采用 UALink over Ethernet(UALoE)实现 scale-up 纵向扩展,单 GPU 纵向扩展带宽 3.6TB/s,横向扩展 600GB/s(由三块 800G Vulcano NIC 提供);整个机架的 scale-up 总带宽达 260TB/s,scale-out 达 43TB/s——后者比同级竞品高出 50% 以上。

UALink 是 AMD 联合 Broadcom、Intel 等共同推动的开放标准,目标是打破 NVLink 的封闭生态。选择"UALink 跑在以太网上"而非另起炉灶的专有协议,有三层考量:

  1. 生态复用:数据中心以太网的技术栈、运维体系与供应链已经高度成熟,复用以太网物理层可以大幅降低部署门槛。
  2. 供应商多元:开放标准意味着交换芯片、网卡、线缆可以有多个供应商,客户不再被单一家族的网络产品绑定。
  3. 与 OCP 协同:UALink 与 OCP 的机架规范天然衔接,形成从芯片到机柜的完整开放栈。

与之对照,NVIDIA 的 NVLink 路线追求极致的私有优化——每 GPU 互联带宽更高、协议延迟更低,但代价是生态锁定。两条路线的胜负,取决于开放生态的成熟速度能否追上垂直整合的性能优势。

44OU ORW 机架:被物理约束塑造的工程设计​

Hot Chips 2026 上披露的机架工程细节,展示了巨型 AI 系统在数据中心物理约束下的真实样子。

工程维度Helios 机架参数
机柜规格44OU ORW 双宽机架(Open Rack Wide v3)
托盘布局18 个计算托盘 + 6 个交换托盘
散热全液冷 + 液冷快速接头
供电50V 直流母线
整机重量超过 7000 磅

这组数字背后是严酷的物理现实。72 颗高功耗 GPU 加 18 颗 CPU 使机架功率达到 225-245kW,传统风冷在如此功率密度下已经无能为力,全液冷成为唯一选项,液冷快速接头则是为了支持托盘级热插拔维护——在价值 500 万美元以上的机架中,停机时间就是真金白银。

50V 直流母线的选择同样有讲究:相比传统交流配电,直流母线减少一次 AC-DC 转换损耗,且在高功率密度下配电铜排更省空间。而超过 7000 磅的整机重量,则意味着数据中心的地板承重、搬运路线乃至建筑结构都需要为此重新评估——这也是它与 Meta 共研 ORW(Open Rack Wide)设计的意义:让宽体机架成为行业可复用的开放标准,而不是每家云厂商各造一套。

量产节奏与客户版图​

Helios 的交付节奏已经进入兑现期:2026 年 7 月开始量产,Q3 末首批出货,Q4 放量。客户侧的版图同样清晰:

  • 微软:2026 年 7 月宣布扩大合作,在 Azure 大规模部署 Helios 机架级系统,明确用于前沿模型推理而非训练。
  • Oracle:被列为 Helios 早期采用者。
  • OpenAI:6GW 级合作协议,首批 1GW 基于 MI450 系列,计划 2026 年 Q4 启动 Helios 规模化上架,2027 年进入加速投放周期。
  • Meta:最多 6GW 的 AMD GPU 部署计划,正测试 Helios 机架与第六代 EPYC,并与 AMD 共研基于 MI450 架构的定制加速器。
  • TCS:将 Helios 带到印度市场。
  • HPE:开放机架合作,加入 Dell、Supermicro、Lenovo 的 OEM 阵容。
  • 主权 AI:Helios 平台也将助力美国主权 AI 工厂超算建设。

OpenAI 与 Meta 合计 12GW 以上的合作规模,是检验 Helios 商业模式的试金石。AMD 用认股权证与战略投资绑定头部客户的模式(如向 OpenAI 发行最多 1.6 亿股认股权证),本质是把未来收入与客户增长深度绑定——如果兑现,AMD 将在 AI 加速器市场获得实质性的第二供应商地位。

小结​

Helios 不只是一台更大的机柜,而是 AMD 对 AI 基础设施的一次完整表态:用 UALink 与 OCP 的开放标准对抗 NVLink 的垂直整合,用显存容量与 scale-out 带宽的数字优势切入推理市场,用与 Meta 共研的 ORW 机架设计把工程经验沉淀为行业规范。7000 磅的重量、50V 直流母线与全液冷快速接头提醒我们,AI 竞争已经深入到供电、散热与承重这样的物理细节。接下来真正的问题只有一个:6GW 订单的兑现节奏,能否跟上纸面参数的漂亮程度。

互联标准战争:NVLink、UALink、UEC 与灵衢的四方博弈

· 6 min read
Industry Research Team

当单芯片晶体管增速放缓,算力的增长叙事就从"更快的芯片"变成"更多的芯片"——而把几百上千颗芯片粘成一台计算机的那根线,正成为 AI 基础设施竞争最激烈的一层。

为什么 scale-up 互联成为新战场​

大模型训练与推理的本质是大量芯片协同计算,芯片间每次交换数据都要经过互联网络。互联带宽决定了两件事:并行扩展效率(加卡能换来几成算力)和内存池化能力(跨卡显存能否当作一块用)。华为马尔科夫实验室的仿真给过一个直观口径:传统 8 卡服务器组网下,集群内通信占训练时间超过 40%;换成大规模超节点组网后 MFU 可提升 2.75 倍——互联不是配套件,而是算力本身。

于是"机架级计算"成为 2026 年的主流形态:NVIDIA 的 NVL72、AMD 的 Helios 72 卡机架、华为的 4096 卡超节点,都是在互联层下注。四方标准就此正面相遇。

四方标准对比表​

维度NVLink 6(NVIDIA)UALink / UALoE(AMD 阵营)Ultra Ethernet(UEC)灵衢 UnifiedBus(华为)
单卡带宽Rubin R200 单 GPU 3.6TB/sMI455X 单 GPU scale-up 3.6TB/s(UALoE);横向扩展 600GB/s以太网生态扩展,43TB/s 级机架出口昇腾 950/960 单卡 2TB/s
机架级带宽NVL72 总计 260TB/sHelios 72 卡 scale-up 约 260TB/s、scale-out 43TB/s以太网交换机标准演进960 超节点 4096 卡,RTT 2μs
开放度NVLink Fusion 向伙伴开放集成自定义 CPU/芯片UALink 开放规范,UALoE 走以太网物理层开放联盟,多厂商互通开放灵衢 2.0 总线生态,自研为主
生态绑定深度绑定 CUDA绑定 ROCm + OCP 开放标准生态最广、厂商中立绑定 CANN/MindSpore
代表系统Vera Rubin NVL72AMD Helios(Open Rack Wide v3)UEC 联盟成员网络Atlas 960 超节点

两组数字颇有意味:NVIDIA 与 AMD 的单 GPU scale-up 带宽同为 3.6TB/s,72 卡机架级 scale-up 带宽同样约 260TB/s——在纵向扩展这一层,两条路线的物理指标已经打平,胜负手转向开放度与生态。

开放标准与垂直整合的两条路线​

NVIDIA 走的是垂直整合加有限开放:NVLink 6 从交换芯片到拓扑全部自研,NVL72 的 260TB/s 全互联带宽是系统级护城河;但 NVLink Fusion 开始向合作伙伴开放,允许第三方把自定义 CPU、加速芯片接入 NVLink 域——既保住标准控制权,又吸纳外部设计。

AMD 走的是彻底的开放标准路线。Helios 机架基于 OCP 的 Open Rack Wide v3 规范(ORW 设计与 Meta 共研),互联组合是 Infinity Fabric + UALink + Ultra Ethernet,配自研 Pensando Vulcano 800G 网卡;MI455X 的 UALoE(UALink over Ethernet)干脆把 scale-up 流量架在以太网物理层上,让客户用标准以太网设备搭建 260TB/s 的纵向扩展域。UEC 则从横向扩展切入,目标是让万卡级集群的跨机网络也走开放以太网。

华为灵衢是第三条路:自研协议、开放生态。灵衢 2.0 总线支撑昇腾 950 的 2TB/s 单卡互联与 1024 卡超节点,昇腾 960 超节点用"灵衢 + Hi-ONE 光引擎"做到单节点 4096 卡、1PB HBM、RTT 2μs,多节点经灵衢网络组网最大 51.2 万卡,叠加多轨道拓扑可达 100 万卡集群——在规模上限上反而是四者中最激进的。

Token Fabric 的"中立性"悖论​

2026 年 10 月 8 日,多厂商互联平台 Upscale AI 发布 Token Fabric,NVIDIA 也出现在投资方名单里。它试图提供一个厂商中立的机架级互联方案,让不同家的加速器共处一个 scale-up 域。

但这里存在一个悖论:真正需要中立方(被 NVLink 锁定的二线芯片厂商)欢迎它,而制定标准的头部厂商(正是 NVLink、UALink、灵衢的持有者)都有动机让它名存实亡。NVIDIA 参投 Token Fabric 更可能是防守性布局——与其被排除在开放阵营外,不如进去施加影响。互联标准的"中立平台"能否存活,取决于超大规模云厂商是否愿意为去锁定支付溢价;从 OCP 阵营的扩张速度看,至少在 AMD Helios 这类系统上,开放路线已经拿到了第一个规模化验证。

给采购方的评估维度​

面对四方标准,采购方可以用四个维度打分:一是 scale-up 域内的有效带宽与扩展效率(MLPerf 等实测口径,Rubin NVL72 在 288 卡演示中达到 99% 扩展效率);二是内存池化能力——互联是否支持跨卡统一编址,这直接决定超大模型的部署方式;三是生态绑定成本——CUDA/ROCm/CANN 的迁移代价往往比硬件差价更大;四是供应链弹性——开放标准(UALink/UEC/OCP)意味着多供应商议价权,垂直整合意味着更紧的集成但更少的集成风险。

小结​

互联标准的四方博弈,本质是三种产业模式的对撞:NVIDIA 的垂直整合加 NVLink Fusion 有限开放,AMD 阵营的 UALink/UEC/OCP 全开放路线,华为的自研灵衢加超节点规模策略。物理指标上单卡 3.6TB/s、机架 260TB/s 已成 2026 年的"对齐线",下一阶段的差异化将来自光互联(Hi-ONE 的 NPO 路线)和内存语义扩展。对采购方而言,标准之争没有旁观席——今天选的互联,决定了未来五年被谁的生态锁定。

从风冷到液冷:AI 机柜功耗狂飙下的散热革命

· 7 min read
Industry Research Team

十年前一个标准机柜 5-10kW,风冷绰绰有余;今天 Vera Rubin NVL72 约 180kW,AMD Helios 机架 225-245kW,下一代 Rubin Ultra NVL576 更是直指 600kW。散热从"机房辅助工程"升格为"AI 算力的第一性约束",一场从风冷到液冷的革命已不可逆。

为什么风冷在 100kW+ 机柜面前失效​

风冷的物理极限很好理解:空气比热容小、密度低,带走同样热量需要的体积流量巨大。机柜功耗超过 100kW 后,风冷会同时撞上三堵墙:

  1. 风量墙:单机柜 100kW 需要的冷风量超出地板下送风与机柜前门的物理供给能力,冷热气流短路、局部热点不可避免;
  2. 噪音与能耗墙:暴力风扇转速拉满,风扇功耗可占整机 10% 以上,机房噪音远超职业健康标准;
  3. 芯片密度墙:单卡 TDP 已从 H100 的 700W 涨到 Rubin R200 的 1800-2300W——这个量级的芯片,散热器与芯片之间的空气层本身就是绝热层,风冷在物理上无法把 2000W 从 die 表面带走。

结论很直白:当单卡功耗突破千瓦级、机柜突破百千瓦级,液冷不再是选项,而是必需品。NVIDIA 对 Rubin R200 的官方口径就是四个字——必须液冷。

机柜功耗演进:五年 100 倍的狂飙​

平台机柜功耗散热方式
传统服务器机柜5-15 kW风冷
GB300 NVL72~140 kW液冷为主
Vera Rubin NVL72(VR200)~190-230 kW全液冷
Rubin Ultra NVL576~600 kW全液冷 + 新一代供电

这条曲线(Thunder Compute 汇总口径)解释了为什么整个产业链都在围绕散热重构:机柜每上一个台阶,供配电、冷却水路、机房承重全部要重新设计。值得一提的是,散热还有"另一种解法"——华为昇腾 960 超节点用 NPO 光互连替代 4.8 万颗 800G 光模块,直接省下 550kW:最好的散热,有时是不产生这份热量。

技术梯队:冷板、浸没式与侧门冷却​

液冷按冷却介质与发热元件的距离分为三档:

技术方案原理散热能力改造成本成熟度
冷板液冷冷水板贴住 GPU/CPU 等高热元件单柜 100-300kW中主流量产方案
侧门冷却(Rear Door HX)机柜后门内置水冷换热器冷却排风单柜 50-150kW低过渡方案
浸没式液冷整机浸入介电液体极高,且可回收余热高特定场景试点

当前产业主流是冷板液冷:GPU、CPU 等热源元件用冷板覆盖,其余内存、硬盘仍靠风冷辅助,形成"液冷为主、风冷兜底"的混合形态。它的优势是可以在现有服务器形态上渐进改造,且不改变元器件可维护性。浸没式散热能力天花板最高、PUE 可逼近 1.05,但介电液体成本、服务器浸入后的可维护性与承重要求,使其仍局限于特定高密度场景。侧门冷却则是风冷机房"续命"的过渡选项。

50V 直流母线与液冷快速接头:工程细节里的魔鬼​

散热革命从来不只是"换水冷板",它牵动整机柜的供电与水路重构。AMD Helios 机架的工程细节最具代表性:

  • 44OU ORW 双宽机架:采用 Open Rack Wide v3 标准,机架宽度加倍,为 72 颗 MI455X + 18 颗 EPYC Venice 留出空间;
  • 18 个计算托盘 + 6 个交换托盘:计算与网络托盘分层布置,托盘化设计让故障节点可整体抽出更换,水路随托盘断开;
  • 液冷快速接头:每个托盘使用免工具快速接头,拔插自动密封不漏液——这是液冷能否规模化运维的关键:机房不可能为换一张卡而整体排水;
  • 50V 直流母线:整机柜采用 50V 直流配电架构,替代传统多级 AC-DC 转换,减少变换级数、提升供电效率,与 NVIDIA 侧的 800V HVDC 演进方向殊途同归;
  • 重量超 7000 磅(约 3.2 吨):装满冷却液与 72 颗 GPU 的机架对机房楼层承重提出全新要求,液冷机柜的"体重"本身就是部署约束。

Helios 机柜 TDP 225-245kW,与 Vera Rubin NVL72 的约 180kW 处在同一量级——头部厂商已默契地收敛到"百千瓦级液冷机柜 + 直流母线供电"的新范式。

功耗-散热-电力:三级约束链​

机柜功耗狂飙的尽头是电网。当前 AI 数据中心面临一条层层传导的约束链:

芯片功耗 → 机柜散热能力 → 机房电力容量 → 区域电网供给。

  • 电力缺口:部分新建数据中心等不及电网扩容——Oracle 用燃气卡车"运电"应急;戴尔与日本 Jera 合作投资 150 亿美元在东京建设 400MW 离网 AI 数据中心,自含燃气电厂,计划 2028 年运营。算力需求已快到"自己发电"的地步;
  • 联盟与标准:AEMA(电网响应联盟)推动数据中心参与电网调峰响应;NVIDIA 则以 DSX 平台展示能效路线——同功率下 token 吞吐提升 24%、每瓦性能提升 23%,证明"省电"的最前沿其实在芯片与系统层;
  • 散热的边界:每一瓦耗电最终都要变成一瓦热,被冷却系统搬运到室外。PUE(总耗电/IT 耗电)每降 0.1,就意味着数千千瓦的冷量系统节省——这也是为什么液冷的 ROI 不能只算电费。

三级约束环环相扣:电网约束机房选址,机房电力约束可部署机柜数,散热能力约束单机柜能塞进多少卡——最终都折算成你能买到的算力总量。

给部署方的建议​

  1. 按液冷标准规划新机房:新建设施直接按 150kW+/机柜的液冷密度设计承重、水路与管井,避免两年后推倒重来;
  2. 冷板优先,浸没观望:冷板液冷生态与运维成熟度最高;浸没式适合高密度推理等特定负载,不建议作为通用方案首批落地;
  3. 关注直流供电架构:评估机柜级 50V 直流母线或更高压 HVDC 方案,转换级数越少,长期电费与可靠性收益越大;
  4. 把 PUE 纳入采购决策:本站的 TCO 计算器支持设置 PUE 参数,输入机柜功耗与 PUE 后即可模拟五年电费差异——液冷机柜贵出来的那部分钱,往往两三年内就会被电费差价抹平;
  5. 别忽略"减热"路线:光互连(如 NPO 省电 550kW)、更高能效芯片(每瓦性能提升 23% 的系统级优化)同样是散热压力的解药,买算力时把系统能效纳入比价。

小结​

AI 机柜功耗从 100kW 冲向 600kW 的曲线,把散热从幕后推向台前。冷板液冷成为主流范式,50V 直流母线与快速接头定义了新一代机柜工程标准,而电网约束则把战场延伸到能源侧——燃气电厂进园区、调峰联盟成立、每瓦性能成为核心 KPI。未来的 AI 算力竞争,本质上是"每瓦 token"的竞争:谁能更高效地把电变成热、再把热搬走,谁就能部署更多算力。

HBM-DRAM-NAND 三层重构:KV Cache 如何改变存储金字塔

· 6 min read
Industry Research Team

过去十年,存储金字塔的分工非常清晰:HBM 伺候计算核心,DRAM 扛系统内存,NAND 做持久化。2026 年,Agentic AI 的 KV Cache 把这条界线搅得七零八落——上下文越来越长,显存越来越装不下,HBM-DRAM-NAND 三层正在被重新定义。

Agentic AI 的 KV Cache 问题​

传统聊天机器人的一次请求,上下文不过几千 token;而 Agent 的工作方式是在一个会话里连续执行几十步任务——浏览网页、读写文件、调用工具、自我反思——每一步都要携带完整的对话历史。上下文从 8K 涨到 100 万 token(NVIDIA RTX Spark 已支持最长 100 万 token 上下文),KV Cache 的体积也随之线性膨胀。

问题在于 KV Cache 必须常驻显存才能避免重复计算。以 Rubin R200 为例,它配备 288GB HBM4、带宽 22TB/s,看似充裕,但在多路并发服务时,模型权重占掉一块,剩余空间很快就会被活跃会话的 KV Cache 吃满。上一代 Blackwell Ultra(B300)之所以把显存从 192GB 提到 288GB HBM3e,官方场景里明确有一条就是"长上下文 KV Cache 288GB 完整保留"——显存的增长节奏,正在被 KV Cache 而不是模型参数牵着走。

当单卡显存装不下时,业界给出的答案是:别把 KV Cache 困在 HBM 里,让它沿着存储金字塔往下走。

三层金字塔:角色被重新定义​

Vera Rubin 平台是这场重构的最佳样本。它的"七芯片堆栈"包含 Vera CPU、Rubin GPU、NVLink 6 交换机、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 以太网交换机和 Groq 3 LPX,其中内存系统呈现清晰的三层结构:

层级介质代表硬件容量/带宽新角色
热数据层HBM4Rubin R200(8 堆栈)288GB / 22TB/s活跃 KV Cache、模型权重
温热数据层LPDDR5XVera CPU1.5TB / 1.2TB/sKV 缓存卸载、与 HBM 构成单一一致性内存池
冷数据层NAND(SSD)BlueField-4 驱动的推理上下文内存存储平台PB 级会话持久化与跨请求复用,token 吞吐最高提升 5 倍

关键变化有三点。其一,LPDDR5X 与 HBM4 之间建立了单一一致性内存池——Vera Rubin NVL72 机柜内,72 颗 GPU 共享 20.7TB HBM4,36 颗 Vera CPU 提供 54TB LPDDR5X,KV Cache 可以在不损失一致性语义的前提下在两层间流动。其二,BlueField-4 不再只是安全卸载卡,而是被定位为"推理上下文内存存储平台",把结束回合的会话上下文写入 NAND,下次请求命中时直接回灌,省去重新 prefill 的算力开销。其三,NAND 从"存储盘"升级为"上下文内存",这是金字塔底层几十年来第一次获得计算语义。

HBF、PIM、M900:案例对比表​

围绕这条三层链路,整个存储产业在 2026 年密集出招:

方案厂商技术要点目标场景
HBF(高带宽闪存)SK海力士(AI Infra Summit 2026 "New Spectrum" 组合)给 NAND 加上类 HBM 的超宽接口KV Cache 冷层,带宽接近 DRAM 量级
PIM 存内计算SK海力士在 DRAM 附近完成部分计算,减少搬运KV Cache 原地更新
eSSD + SALT-KVSK海力士面向 KV Cache 语义优化的键值存储栈推理上下文持久化
OceanStor M900华为上下文内存存储集群,灵衢总线一跳直连 PB 级 KV Cache,SSD 读写寿命延长 16 倍昇腾超节点的 KV 基建
NVHBM 定制内存AWS Annapurna × NVIDIA面向 AI 负载的定制 HBM 方案云厂商定制化
超密度服务器内存模组美光(2026-09-15)单模组容量再上一档DRAM 温热层扩容

SK海力士还专门设立了 SK hynix Ventures(9 月 18 日落地硅谷),用投资孵化初创公司的方式押注"内存即基础设施"这条新赛道。值得注意的是华为 OceanStor M900:它与昇腾 960 超节点同期发布,通过灵衢总线一跳直连,把 PB 级 KV Cache 集群变成超节点的"外挂记忆体",并通过磨损均衡等手段把 SSD 读写寿命延长 16 倍——上下文存储的写放大问题,第一次被当成显性的工程指标来攻克。

协同设计取代采购​

这轮重构背后,是产业关系的转向:存储不再是"按目录价采购的标准件",而是与加速器协同设计的定制组件。NVIDIA 联合 AWS Annapurna 做 NVHBM,华为为昇腾自研 HBM 并配套 OceanStor M900,SK海力士直接下场定义 KV 存储软件栈。美光甚至在 9 月的口径中预测 NAND 与 DRAM 短缺将持续到 2028 年——在供不应求的市场里,谁能锁定定制内存供给,谁就握住了推理产能。

对芯片厂商而言,算力竞争的上半场比的是 FLOPS,下半场比的将是"每 token 需要搬运多少字节"。带宽金字塔的每一层接口,都成了架构设计的一等公民。

对推理 TCO 的影响​

这套三层结构对成本模型的影响是直接的。第一,KV Cache 卸载到 DRAM 和 NAND 后,同样规模的 HBM 可以服务更多并发会话,单 token 的 HBM 摊销成本下降。第二,BlueField-4 上下文存储平台宣称 token 吞吐最高提升 5 倍,本质上是把重复 prefill 的 GPU 算力换成了廉价的 NAND 读取——用存储的"宽"换算力的"贵"。第三,内存已占整机 TCO 约 40%(HBM 涨价后的行业口径),存储分层做得越细,整体成本曲线越平缓。

小结​

KV Cache 正在把存储金字塔从"容量阶梯"改造成"温度阶梯":HBM 保活跃、DRAM 承接温热会话、NAND 做上下文持久化,三层之间以一致性内存池和专用存储平台(BlueField-4、OceanStor M900)贯通。SK海力士的 HBF/PIM/SALT-KV 与美光的超密度模组说明,存储大厂已经从跟随 AI 转向定义 AI 基础设施。下一阶段推理成本的胜负手,不在 GPU 的 FLOPS 表格上,而在三层存储之间的数据搬运路线上。

MI400 系列盘点:MI430X 驱动欧洲 LUMI-AI 超算,AMD HBM4 家族成型

· 6 min read
Industry Research Team

当 MI430X 与第六代 EPYC 确定驱动欧洲 LUMI-AI 超算,AMD 的 HBM4 家族不再只是 PPT 上的参数表,而是正在被国家级算力项目、超大规模云厂商与 AI 实验室同时验证的产品矩阵。本文盘点 MI400 系列的完整版图,以及它背后的收购组合拳。

MI400 系列:一张覆盖三大场景的产品矩阵​

MI400 系列于 CES 2026 正式发布,在 Advancing AI 2026 上确认了清晰的 SKU 分层。三款产品覆盖了数据中心采购的三种典型场景:

型号定位显存算力出货时间
MI455X前沿训练 + 推理旗舰(Helios 机架专用)432GB HBM440 PFLOPS 级 MXFP4(dense)2026 H2 起量产
MI430XHPC / 主权 AI(硬件 FP64 加速)432GB HBM4硬件 FP64 288 TFLOPS2027 H1
MI350P企业存量升级(风冷 PCIe)144GB HBM3E4.6 PFLOPS MXFP4已出货

再往远看,AMD 已在 Advancing AI 2026 预告了下一代 MI500 系列:CDNA 6 架构、台积电 2nm、HBM4E 显存,预计 2027 年发布,由 AMD 与 OpenAI 联合定义开发。从 MI400 到 MI500,加上此前的 MI350(CDNA 4)与 MI300X,AMD 的产品路线第一次形成了以年度为节奏的完整梯队,而非零星的单点反击。

值得注意的是,MI455X 与 MI430X 共享同一套 CDNA 5 加 432GB HBM4 的硬件底座——AI 吞吐优先与 FP64 精度优先通过同一平台的不同调校实现,这大幅摊薄了研发与生态适配成本。

MI430X:用 FP64 锁定国家级超算​

MI430X 是 MI400 家族中最具象征意义的一款。它与 MI455X 同样配备 432GB HBM4、23.3TB/s 带宽,但核心差异在于原生硬件级 FP64 双精度:288 TFLOPS,约为 NVIDIA Vera Rubin 的 8.7 倍。这是一个精准卡位——双精度科学计算是 NVIDIA 在消费级 AI 浪潮中相对弱化的领域,而它恰恰是国家级超算的刚需。

MI430X 已经锁定两套国家级系统:

  • 美国 ORNL "Discovery":橡树岭国家实验室新一代超算,2028 年部署;
  • 法国 "Alice Recoque":GENCI 与 CEA 联合打造的欧洲系统。

AMD 官方已在 8 月 4 日财报电话会确认,MI430X 正在 ORNL 与法国 Jean Zay 的 exascale 级超算中运行。而根据最新进展,MI430X 与第六代 EPYC 将共同驱动欧洲 LUMI-AI 超算——LUMI 是欧洲最强的超算系统之一,其 GPU 分区此前基于 MI250X,此次升级至 HBM4 平台,是欧洲主权 AI 对 AMD 路线的直接背书。

超算背书对 ROCm 生态的拉动​

国家级超算项目的价值远超订单本身。超算是软件生态最好的试炼场:混合精度科学计算、大规模 MPI 并行、异构调度,这些极端场景会把 ROCm 的短板逼出来并倒逼修复。同时,超算项目通常要求开源软件栈与长期维护承诺,这与 ROCm 的开源路线天然契合。ORNL、Jean Zay、Alice Recoque、LUMI-AI 构成的"超算联盟",正在为 ROCm 提供一种商业市场买不到的信誉资产——当欧洲与美国的公共算力项目都选择 AMD 时,商业客户的采购顾虑会显著降低。

平台协同:EPYC Venice 与 2nm 双线量产​

MI400 家族的算力释放离不开主机侧的配套。第六代 EPYC "Venice"(Zen 6,最高 256 核,1.6TB/s 内存带宽)已在台积电 2nm 产线启动量产,并延伸至美国亚利桑那工厂——这使 AMD 成为唯一在两个地区都有先进制程量产能力的 x86 服务器 CPU 厂商。下一代 "Verano" 已为 AI 工作负载预留设计,将延续 CPU 与 GPU 平台协同的打法。

CPU 与 GPU 的协同不是简单的搭配销售。在 Helios 机架中,每托盘 4 颗 MI455X 配 1 颗 Venice,CPU 负责数据搬运与调度,CPU-GPU 互联带宽是上一代的 2 倍。对推理集群而言,主机侧的数据预处理好坏直接影响 GPU 利用率——这正是 AMD"CPU 加 GPU 双引擎"路线在 AI 时代的复利。

收购组合拳:内存、推理与空间智能​

围绕 MI400 平台,AMD 在 2026 年展开了一组方向明确的收购:

收购标的能力方向战略意图
MEXT内存访问优化强化 HBM4 时代的显存子系统效率
Taalas快速推理硬件补充推理专用架构能力
World Labs空间智能 / 物理 AI卡位世界模型与机器人时代

三笔收购分别对应内存、推理与物理 AI 三条线,加上与 OpenAI、Meta 各约 1000 亿美元级的合作以及 Anthropic、微软的合作,AMD 正在从"卖芯片"走向"卖 AI 基础设施能力"。这组拼图的完整解读,我们将在后续文章中展开。

市场机会与追赶空间​

AMD 管理层看到的机会窗口清晰而巨大:推理与数据中心 CPU 合计 2200 亿美元的市场机会。推理是 AI 商业化落地的主战场——训练市场已被 NVIDIA 牢固占据,但推理市场的格局远未定型,对显存容量、单位 token 成本与开放生态的敏感度更高,这正是 MI400 家族的差异化所在。

但差距同样不能回避:AMD 的市值仍不足 NVIDIA 的五分之一,CUDA 生态的迁移成本依然存在。分析师普遍认为,这种差距本身就是追赶空间——如果 MI400 系列与 Helios 的 6GW 级订单按期兑现,AMD 在 AI 加速器市场的份额将获得结构性提升。

小结​

MI400 系列的意义在于"家族成型":MI455X 打前沿训练与推理,MI430X 用 FP64 锁定 HPC 与主权 AI,MI350P 覆盖企业存量升级,MI500 预告下一代——四个层次共享平台底座,配合 EPYC Venice 的 2nm 双厂量产,AMD 第一次拿出了一条完整、连贯、可预期的数据中心产品线。LUMI-AI 等超算的背书正在为 ROCm 生态积累信誉,而 MEXT、Taalas、World Labs 的收购则为这张版图补上了内存与物理 AI 的拼图。2027 年 MI430X 正式出货时,我们将能看到这套组合拳的完整威力。

光进铜退:NPO/CPO 光互连如何重塑超节点架构

· 7 min read
Industry Research Team

当超节点从 72 卡扩张到 4096 卡,铜缆互连在功耗与距离面前彻底缴械。2026 年 9 月,华为发布全球首个采用 NPO(近封装光学)技术的超节点,用 5500 个光引擎替代 4.8 万颗 800G 光模块、省电 550kW——"光进铜退"从口号变成了工程现实。

可插拔光模块的功耗天花板​

传统数据中心组网依赖可插拔光模块:交换机面板上插着 400G、800G 的模块,通过光纤连接各节点。这套体系成熟、可维护,但在 AI 超节点规模下撞上了天花板。

华为披露的数字最具说服力:若用传统方案支撑昇腾 960 超节点的组网需求,需要约 48000 颗 800G 光模块。每颗 800G 可插拔模块功耗约 15-25W,4.8 万颗意味着仅光互连部分就要消耗兆瓦级电力,还不算 SerDes 链路、面板空间与故障率代价。更进一步,可插拔模块的 DSP 重定时环节占据了模块功耗的大头,且离交换芯片越远、信号损耗越大——模块越密,这场"功耗税"越重。

对于动辄数千卡、训练十万亿参数模型的超节点而言,光互连的功耗与可靠性直接决定了系统能建多大。这就是"光进铜退"的起点:把光引擎从面板挪到芯片身边,甚至塞进封装里面。

NPO、CPO、OIO:光互连技术梯队​

按光引擎与芯片的距离由远及近,光互连分为三个梯队:

技术方案光引擎位置功耗收益工程成熟度代表
可插拔光模块交换机面板基线成熟,生态完整传统数据中心组网
NPO 近封装光学封装旁的基板上显著降低,光源独立可换已量产昇腾 960 超节点 Hi-ONE
CPO 共封装光学与交换芯片同封装最大幅度降低可靠性/可维护性待解各厂商交换机路线图
OIO 光 IO进入 GPU/芯片封装内部终极形态研究与早期验证下一代超节点探索

NPO 与 CPO 的核心差异在于取舍:CPO 把光引擎与芯片放在同一封装,光电距离最短、功耗最低,但激光器故障要更换整个昂贵封装,可靠性与可制造性一直是拦路虎;NPO 则把光引擎放在封装之外的基板上,保留"独立可插换"的维护性,同时实现光电近距离握手。华为明确解释过为何 960 超节点选择 NPO 而非 CPO:规避 CPO 的可靠性、可制造性、可维护性难题,并延续现有光模块产业生态——这是工程务实主义的典型选择。OIO 则更激进,目标是把光 IO 直接做进 GPU 封装,与 HBM、die 一起共封装,被视为超节点互连的远期方向。

华为 Hi-ONE 案例精算:5500 引擎 vs 4.8 万模块​

昇腾 960 超节点的 NPO 方案给出一组可以精算的对比:

指标传统可插拔方案昇腾 960 NPO 方案
光互连器件~48000 颗 800G 光模块5500 个 Hi-ONE 光引擎
单器件容量800G7.2T(单引擎)
功耗基线降低超 550 kW
无故障运行时间基线提升一倍
整体可用度—99.8%

三个要点值得展开:

  1. 单引擎容量 7.2T:一颗 Hi-ONE 顶 9 颗 800G 模块,器件数量骤降一个数量级,故障点随之大幅减少——这是无故障运行时间翻倍的直接来源;
  2. 省 550kW 意味着什么:550kW 约等于把整个 Vera Rubin NVL72 机柜(约 180kW TDP)的耗电省出近三台,省下的不仅是电费,更是散热系统的建设成本;
  3. 唯一内置光源:Hi-ONE 是业界首个量产、当前传输能力最大且唯一内置光源的 NPO 产品,内置光源意味着激光器与引擎协同设计,省去外置光源的耦合损耗。

配合灵衢 UnifiedBus 全域 D2D 互连(RTT 2μs),这套光互连底座支撑起单节点 4096 卡、8 EFLOPS FP8、1PB HBM 的超节点规模。

光互连对超节点规模的意义:72 卡到 4096 卡的物理前提​

超节点的本质是让大量卡共享统一内存编址、像一台机器一样工作,而互连带宽与时延是规模的第一性约束。华为仿真数据:4K 超节点组成的 10 万卡集群,相比传统 8 卡服务器组网,MFU 提升 2.75 倍——因为在传统架构下,集群内通信占用训练时间超过 40%。

从 72 卡(NVL72 级别)到 4096 卡(昇腾 960 超节点),跨了两个数量级,物理上只有光互连能同时满足带宽密度、传输距离和功耗预算。NPO 把光链路推进到基板级,使跨机柜、跨机行的卡间通信时延降到微秒级,"逻辑上的一台机器"才有了物理载体。再往上,多个 960 超节点经灵衢网络或 RoCE 互联,最大可扩展到 51.2 万卡乃至 100 万卡集群——光互连是这一切的物理前提。

硅光、VCSEL、EML:技术路线与投资热​

光互连的爆发也点燃了产业链与资本市场:

  • EML 激光器:相干与高速光模块的核心光源,分析师口径显示 Lumentum 持有约 60% 的 EML 市场份额,是本轮"光进铜退"最直接的受益者之一;
  • 硅光集成:把调制器、波导、探测器集成在硅片上,与 CMOS 工艺兼容,是 CPO/OIO 时代的主力路线;
  • VCSEL 路线:Volantis 用类似 Face ID 的垂直腔面发射激光器连接 AI 芯片与内存芯片,主打短距、低成本,斩获 8800 万美元 A 轮融资;
  • 加速器光互连创业潮:CScale 开发面向加速器的光互连技术,C 轮融资 1.45 亿美元;Upscale AI 推出多厂商芯片互联的 Token Fabric 平台,获 NVIDIA 参投(2026-10-08)。

从激光器材料、硅光工艺到系统级创业公司,资本正沿光互连链条全面下注——这与当年 HBM 军备竞赛的剧本如出一辙。

小结​

光互连不再是数据中心的"锦上添花",而是超节点规模的"生死线"。可插拔光模块在 4.8 万颗的量级上暴露了功耗天花板,NPO 用 5500 个光引擎交出了省电 550kW、可用度 99.8% 的量产答卷,CPO 与 OIO 则代表着更彻底的光电融合。当卡间通信成为训练时间的大头,"光进铜退"就不再是技术偏好,而是算力扩张的唯一出路。

一颗 GPU 背后的七颗芯片:NVIDIA "七芯片堆栈"战略全拆解

· 7 min read
Industry Research Team

当竞争对手还在对比单颗 GPU 的 FLOPS 时,NVIDIA 已经把战场挪到了另一个维度。2026 年 GTC 发布的 Vera Rubin 平台,表面上是"新一代 GPU",实际上是一套由七颗芯片组成的完整 AI 工厂蓝图。据站内芯片数据库,这七颗芯片分别是:Vera CPU、Rubin GPU、NVLink 6 交换机、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 以太网交换机,以及 Groq 3 LPX。本文逐一拆解这套"七芯片堆栈"的分工、协同与战略意图。

七颗芯片,各司其职​

先看全局分工表(数据据站内芯片数据库):

#芯片角色关键规格
①Vera CPU主机调度中枢88 核自研 Olympus、1.5TB LPDDR5X、1.2TB/s
②Rubin GPU训练与 prefill 主力288GB HBM4、22TB/s 带宽、50 PFLOPS FP4
③NVLink 6 交换机纵向扩展互联单 GPU 3.6TB/s、NVL72 机柜 260TB/s
④ConnectX-9 SuperNIC横向扩展网络单端口 1.6T、延迟低于 0.5μs、GPUDirect
⑤BlueField-4 DPU基础设施卸载与存储驱动第三层推理上下文内存存储平台,token 吞吐最高 5 倍
⑥Spectrum-6 交换机数据中心以太网骨干Scale-out 网络核心
⑦Groq 3 LPX智能体解码加速256 颗 LPU/机架、128GB 聚合 SRAM、40 PB/s

七颗芯片覆盖了 AI 工厂从计算、互联、网络到存储的每一层——这是一个信号:NVIDIA 卖的不再是芯片,而是一整座工厂的参考设计。

计算层:Vera + Rubin + LPX 的异构三重奏​

计算层的分工体现了"每 token 经济学"的推理:

Rubin GPU 负责训练与 prefill。3360 亿晶体管、22TB/s 显存带宽,让它成为吞掉训练算力与推理 prefill(吃算力)这两个负载的最优解。

Groq 3 LPX 专攻智能体 decode。据站内芯片数据库,LPX 机架集成 256 颗 LPU,聚合 128GB 片上 SRAM 提供高达 40 PB/s 的片上带宽,互联达 640 TB/s。decode 阶段的核心瓶颈是内存带宽而非算力,LPU 用超大片上 SRAM 绕开这一瓶颈,延迟达到纳秒级——对于每秒上千次调用的 agentic AI 负载,这是 GPU 结构上难以企及的能力。GPU 管 prefill、LPU 管 decode,两种架构各干各的,总成本反而更低。

Vera CPU 是调度中枢。88 个自研 Olympus 核心、第二代 SCF 一致性结构(3.4TB/s 对分带宽)、1.5TB LPDDR5X 与 HBM4 构成单一一致性内存池,负责数据搬运调度、内存管理与系统控制编排——海量的智能体沙盒、KV 缓存卸载、多模型并发,都由它承接。

AI 工厂的网络是分层的,NVIDIA 用三颗芯片精确对应:

  • NVLink 6 交换机(Scale-up):机柜内纵向扩展,单 GPU 3.6TB/s 全互联带宽,让 72 乃至更多 GPU 像一颗 GPU 一样工作。这是训练超大模型的命脉,也是 NVIDIA 最深的护城河;
  • ConnectX-9 SuperNIC(Scale-out):单端口 1.6 Tb/s 的跨机柜网络,延迟低于 0.5 微秒,支持 GPU-NIC 直接 DMA,决定集群的横向扩展效率;
  • Spectrum-6 以太网交换机:承载南北向流量与存储网络,是数据中心以太网骨干。

三级网络的本质是把"AI 工厂"拆解成可量化的工程指标:token 从进入机房到输出,要经过计算、Scale-up、Scale-out、存储四类路径,NVIDIA 在每一条路径上都放了一颗自己设计的芯片。

BlueField-4:被忽视的第三层存储革命​

七芯片堆栈中最容易被低估的是 BlueField-4 DPU。它的战略意义在于驱动第三层推理上下文内存存储平台——在 GPU 显存(HBM)与主机内存(LPDDR5X)之外,用 DPU 管理一层专门的推理上下文存储,官方宣称可将 token 吞吐提升最高 5 倍。

这重构了经典的 HBM-DRAM-NAND 三层存储金字塔:智能体对话的 KV 缓存、多轮会话上下文,不再挤占宝贵的 HBM4 容量,而是按热度分层放置在三级存储中。对于长上下文、多轮对话的 agentic AI 负载,这一层的存在直接决定了"每 GB 有效 KV 容量成本"——一个纯 GPU 厂商根本无法优化的指标。

七芯片堆栈的封锁性引发过大客户反弹,NVIDIA 的回应是有选择的开放:

  • NVLink Fusion:向合作伙伴开放 NVLink 互联,允许其将自定义 CPU 或加速器集成进 NVIDIA 的 Scale-up 域——用互联标准换取生态驻留;
  • NVHBM 定制内存控制器计划:允许超大规模客户定制 HBM 配置,市场传闻亚马逊 Annapurna 团队正参与合作——把客户自研芯片的冲动,引导为"在 NVIDIA 平台上定制"的合作姿态。

这步棋颇为高明:客户想自研的动机无非是定制与议价,NVIDIA 干脆把定制能力开放出来,但互联与软件栈的根仍握在自己手里。

系统级竞争:对手的对位打法​

Bain 在 2026 年的行业分析给出了一个重要判断:AI 算力的竞争优势正从芯片规格转向系统级整合。这解释了为什么各大厂商都在拼"整栈":

厂商CPUGPU/加速器互联/网络开放程度
NVIDIAVera(自研)Rubin R200NVLink 6 + ConnectX-9 + Spectrum-6NVLink Fusion 有限开放
AMDEPYC VeniceMI455X/MI500Vulcano NIC + UALink开放标准联盟
华为自研鲲鹏系昇腾系列灵衢 UnifiedBus国内生态自主

AMD Helios 机架的组合是 EPYC Venice(256 核 Zen 6)+ MI455X + Vulcano 网络芯片,以 UALink 开放标准对抗 NVLink 的封闭性——用"开放"换生态盟友。华为的灵衢 UnifiedBus 则在国内市场构建对位体系。但双方都面临同一个难题:NVIDIA 的七芯片是同步迭代的——Vera 与 Rubin 同代设计、NVLink 6 为 HBM4 的带宽特性量身定做、LPX 与 GPU 的 prefill/decode 分工在参考架构层面打通。对手的"拼装式整栈"在迭代节奏上天然慢一拍。

小结​

七芯片堆栈是 NVIDIA 对"AI 工厂"时代的一次完整应答:计算层用 Vera、Rubin、LPX 实现异构分工,互联层用 NVLink 6、ConnectX-9、Spectrum-6 铺设三级网络,BlueField-4 则重构了推理存储的金字塔。再辅以 NVLink Fusion 的有限开放与 NVHBM 定制计划,NVIDIA 把竞争维度从"单芯片规格"彻底抬升到"系统级整合"——Bain 的判断在这里得到了最好的注脚。对买方而言,评估下一笔 AI 基础设施投资时,问题已经不该是"这颗 GPU 多少 TFLOPS",而是"这套系统能把每 token 成本压到多少"。谁能回答好后者,谁就赢得下一个五年。