跳到主要内容

从风冷到液冷:AI 机柜功耗狂飙下的散热革命

· 阅读需 7 分钟
Industry Research Team

十年前一个标准机柜 5-10kW,风冷绰绰有余;今天 Vera Rubin NVL72 约 180kW,AMD Helios 机架 225-245kW,下一代 Rubin Ultra NVL576 更是直指 600kW。散热从"机房辅助工程"升格为"AI 算力的第一性约束",一场从风冷到液冷的革命已不可逆。

为什么风冷在 100kW+ 机柜面前失效​

风冷的物理极限很好理解:空气比热容小、密度低,带走同样热量需要的体积流量巨大。机柜功耗超过 100kW 后,风冷会同时撞上三堵墙:

  1. 风量墙:单机柜 100kW 需要的冷风量超出地板下送风与机柜前门的物理供给能力,冷热气流短路、局部热点不可避免;
  2. 噪音与能耗墙:暴力风扇转速拉满,风扇功耗可占整机 10% 以上,机房噪音远超职业健康标准;
  3. 芯片密度墙:单卡 TDP 已从 H100 的 700W 涨到 Rubin R200 的 1800-2300W——这个量级的芯片,散热器与芯片之间的空气层本身就是绝热层,风冷在物理上无法把 2000W 从 die 表面带走。

结论很直白:当单卡功耗突破千瓦级、机柜突破百千瓦级,液冷不再是选项,而是必需品。NVIDIA 对 Rubin R200 的官方口径就是四个字——必须液冷。

机柜功耗演进:五年 100 倍的狂飙​

平台机柜功耗散热方式
传统服务器机柜5-15 kW风冷
GB300 NVL72~140 kW液冷为主
Vera Rubin NVL72(VR200)~190-230 kW全液冷
Rubin Ultra NVL576~600 kW全液冷 + 新一代供电

这条曲线(Thunder Compute 汇总口径)解释了为什么整个产业链都在围绕散热重构:机柜每上一个台阶,供配电、冷却水路、机房承重全部要重新设计。值得一提的是,散热还有"另一种解法"——华为昇腾 960 超节点用 NPO 光互连替代 4.8 万颗 800G 光模块,直接省下 550kW:最好的散热,有时是不产生这份热量。

技术梯队:冷板、浸没式与侧门冷却​

液冷按冷却介质与发热元件的距离分为三档:

技术方案原理散热能力改造成本成熟度
冷板液冷冷水板贴住 GPU/CPU 等高热元件单柜 100-300kW中主流量产方案
侧门冷却(Rear Door HX)机柜后门内置水冷换热器冷却排风单柜 50-150kW低过渡方案
浸没式液冷整机浸入介电液体极高,且可回收余热高特定场景试点

当前产业主流是冷板液冷:GPU、CPU 等热源元件用冷板覆盖,其余内存、硬盘仍靠风冷辅助,形成"液冷为主、风冷兜底"的混合形态。它的优势是可以在现有服务器形态上渐进改造,且不改变元器件可维护性。浸没式散热能力天花板最高、PUE 可逼近 1.05,但介电液体成本、服务器浸入后的可维护性与承重要求,使其仍局限于特定高密度场景。侧门冷却则是风冷机房"续命"的过渡选项。

50V 直流母线与液冷快速接头:工程细节里的魔鬼​

散热革命从来不只是"换水冷板",它牵动整机柜的供电与水路重构。AMD Helios 机架的工程细节最具代表性:

  • 44OU ORW 双宽机架:采用 Open Rack Wide v3 标准,机架宽度加倍,为 72 颗 MI455X + 18 颗 EPYC Venice 留出空间;
  • 18 个计算托盘 + 6 个交换托盘:计算与网络托盘分层布置,托盘化设计让故障节点可整体抽出更换,水路随托盘断开;
  • 液冷快速接头:每个托盘使用免工具快速接头,拔插自动密封不漏液——这是液冷能否规模化运维的关键:机房不可能为换一张卡而整体排水;
  • 50V 直流母线:整机柜采用 50V 直流配电架构,替代传统多级 AC-DC 转换,减少变换级数、提升供电效率,与 NVIDIA 侧的 800V HVDC 演进方向殊途同归;
  • 重量超 7000 磅(约 3.2 吨):装满冷却液与 72 颗 GPU 的机架对机房楼层承重提出全新要求,液冷机柜的"体重"本身就是部署约束。

Helios 机柜 TDP 225-245kW,与 Vera Rubin NVL72 的约 180kW 处在同一量级——头部厂商已默契地收敛到"百千瓦级液冷机柜 + 直流母线供电"的新范式。

功耗-散热-电力:三级约束链​

机柜功耗狂飙的尽头是电网。当前 AI 数据中心面临一条层层传导的约束链:

芯片功耗 → 机柜散热能力 → 机房电力容量 → 区域电网供给。

  • 电力缺口:部分新建数据中心等不及电网扩容——Oracle 用燃气卡车"运电"应急;戴尔与日本 Jera 合作投资 150 亿美元在东京建设 400MW 离网 AI 数据中心,自含燃气电厂,计划 2028 年运营。算力需求已快到"自己发电"的地步;
  • 联盟与标准:AEMA(电网响应联盟)推动数据中心参与电网调峰响应;NVIDIA 则以 DSX 平台展示能效路线——同功率下 token 吞吐提升 24%、每瓦性能提升 23%,证明"省电"的最前沿其实在芯片与系统层;
  • 散热的边界:每一瓦耗电最终都要变成一瓦热,被冷却系统搬运到室外。PUE(总耗电/IT 耗电)每降 0.1,就意味着数千千瓦的冷量系统节省——这也是为什么液冷的 ROI 不能只算电费。

三级约束环环相扣:电网约束机房选址,机房电力约束可部署机柜数,散热能力约束单机柜能塞进多少卡——最终都折算成你能买到的算力总量。

给部署方的建议​

  1. 按液冷标准规划新机房:新建设施直接按 150kW+/机柜的液冷密度设计承重、水路与管井,避免两年后推倒重来;
  2. 冷板优先,浸没观望:冷板液冷生态与运维成熟度最高;浸没式适合高密度推理等特定负载,不建议作为通用方案首批落地;
  3. 关注直流供电架构:评估机柜级 50V 直流母线或更高压 HVDC 方案,转换级数越少,长期电费与可靠性收益越大;
  4. 把 PUE 纳入采购决策:本站的 TCO 计算器支持设置 PUE 参数,输入机柜功耗与 PUE 后即可模拟五年电费差异——液冷机柜贵出来的那部分钱,往往两三年内就会被电费差价抹平;
  5. 别忽略"减热"路线:光互连(如 NPO 省电 550kW)、更高能效芯片(每瓦性能提升 23% 的系统级优化)同样是散热压力的解药,买算力时把系统能效纳入比价。

小结​

AI 机柜功耗从 100kW 冲向 600kW 的曲线,把散热从幕后推向台前。冷板液冷成为主流范式,50V 直流母线与快速接头定义了新一代机柜工程标准,而电网约束则把战场延伸到能源侧——燃气电厂进园区、调峰联盟成立、每瓦性能成为核心 KPI。未来的 AI 算力竞争,本质上是"每瓦 token"的竞争:谁能更高效地把电变成热、再把热搬走,谁就能部署更多算力。