Skip to main content

电比卡贵:AI 数据中心的能源危机与自救

· 6 min read
Industry Research Team

当 Oracle 用卡车运送天然气维持数据中心运转,当戴尔要在东京附近自建燃气电厂,一个事实已经无法回避:在 AI 工厂的成本结构里,电力正在取代芯片成为第一约束。本文梳理这场能源危机的证据链,以及行业的两条自救路线。

电力成为第一约束的证据链​

证据链从芯片功耗表开始。站内 Rubin R200 规格卡显示:单卡 TDP 1800-2300W、必须液冷,Vera Rubin NVL72 机柜整体功耗约 180kW、定价 350-400 万美元。而这只是开始——

平台机架功耗(公开口径)阶段
GB300 NVL72~140kW2026 年现役主力
VR200 NVL72~180-230kW(按单卡 1800-2300W 口径)2026 H2 交付
Rubin Ultra NVL576~600kW2027 H2 目标

机架功耗三年翻四倍,电网侧的配套却以五年为周期规划建设。缺口由此产生,并且已经产生了荒诞但真实的运营现实:据 Bloomberg 确认,Oracle 用卡车运送天然气维持多座数据中心的运转——电网容量跟不上,只能用最原始的物流方式给服务器"送电"。行业分析师给出的方向性数字是 $10 万亿美元级别的数据中心建设需求,其中相当比例将花在电力基础设施上。

需求侧的另一个信号是报建数据:Anthropic 在德州 Cedar Creek 的数据中心项目报建金额为 3.66 亿美元——这还只是头部实验室扩张计划中的一个节点。

自救路线一:离网自建燃气电厂​

第一条路线是不再等电网,自己发电。标志性案例是戴尔与日本 Jera(JERA)、Rhaelm 合作,在东京附近投资 150 亿美元建设 400MW 离网 AI 数据中心,配套燃气电厂,计划 2028 年投入运营。400MW 约等于十几万台高性能 GPU 的供电规模,"芯片厂+能源商+集成商"的组合预示着未来 AI 工厂选址的新范式:哪里有气源,哪里就能建机房。

离网自建的优势是确定性与速度——不受电网排队与扩容审批的制约;代价是资本开支剧增与能源资产的沉没成本。对于有长期算力承诺的超大规模客户,这笔账算得过来;对于中小算力运营商,则更可能通过租用离网机房来间接获益。

自救路线二:电网响应式数据中心​

第二条路线是与电网合作,让数据中心成为电网的"可调负载"。2026 年 9 月 16 日,Emerald AI、Google、NVIDIA 共同成立 AEMA 联盟(先进能源与算力联盟),推动数据中心参与电网需求响应。一个直观的案例来自硅谷:当地电力公司已向 NVIDIA Eos AI 工厂发出 200 余次需求响应信号——每当电网紧张,AI 工厂可以短时降载,换取电价优惠或容量豁免。

这条路线的理论基础是 AI 负载的时间弹性:训练可以断点续跑,推理可以排队,某些批处理任务完全可以错峰。当数万座 AI 工厂都具备柔性用电能力,数据中心就从电网的"负担"变成了"调节资源"。

DSX 的"软件定义能耗管理"玩法​

两条路线之间,NVIDIA 还提供了第三种思路:用软件榨干每一瓦的性能。NVIDIA DSX(含 MaxLPS 等能耗管理组件)在 Lambda 的实测中实现了同功率下 token 吞吐 +24%、每瓦性能 +23%——不增加一度电,多产出近四分之一的智能。

路线代表案例核心逻辑
离网自建戴尔×Jera×Rhaelm 东京 400MW能源自主,绕开电网排队
电网响应AEMA 联盟、Eos 200+ 次需求响应柔性用电,换电价与容量
软件提效NVIDIA DSX:每瓦性能 +23%同功率多出 token

这三种打法并不互斥:现实的 AI 工厂往往是"自备电源打底 + 电网响应削峰 + 软件调度提效"的组合拳。

电力之外的第二个硬约束​

在讨论能源时,别忽略存储。美光给出预测:存储短缺将持续到 2028 年。HBM 与 DRAM 的紧张不仅推高整机成本(站内 Rubin Ultra 卡记录:内存已占整机 TCO 约 40%),还直接限制了单位电力所能部署的算力——当一张 1800-2300W 的 GPU 需要搭配 288GB HBM4 才能发挥性能,存储供给与电力供给实际上是同一个产能问题的两面。

对 AI 工厂选址与 TCO 的影响​

对计划自建或租用算力的团队,能源变量必须写进 TCO 模型:

  1. 电价参数是最大变量。在站内 TCO 计算器中调整电价参数即可发现:当机架功耗进入 200kW+ 区间,三年电费支出可与整机柜购置费同一量级,选址的每度电差价会直接改写回本周期。
  2. 离网溢价与确定性溢价。离网机房的每度电可能更贵,但换取的是不排队、不停电的确定性——对训练任务,停电机会的成本远高于电价差。
  3. 需求响应收益。具备降载能力的机房可从电力公司获得电价优惠,这部分收益在传统 TCO 模型中通常被遗漏,在 200+ 次需求响应信号的硅谷案例里已经真金白银。

小结​

"电比卡贵"不再是修辞:Oracle 的天然气卡车、戴尔的自建电厂、$10 万亿的建设需求,共同勾勒出 AI 算力竞争的下一战场在能源。行业的自救分成三条线——离网自建换取确定性、电网响应换取经济性、软件提效换取每瓦产出。对于在 2027 年计划部署 Rubin Ultra 级 600kW 机架的玩家,今天要谈的不是芯片合同,而是电力协议。算力的尽头是能源,这句话正在从口号变成资产负债表。