从风冷到液冷:AI 机柜功耗狂飙下的散热革命
十年前一个标准机柜 5-10kW,风冷绰绰有余;今天 Vera Rubin NVL72 约 180kW,AMD Helios 机架 225-245kW,下一代 Rubin Ultra NVL576 更是直指 600kW。散热从"机房辅助工程"升格为"AI 算力的第一性约束",一场从风冷到液冷的革命已不可逆。
为什么风冷在 100kW+ 机柜面前失效
风冷的物理极限很好理解:空气比热容小、密度低,带走同样热量需要的体积流量巨大。机柜功耗超过 100kW 后,风冷会同时撞上三堵墙:
- 风量墙:单机柜 100kW 需要的冷风量超出地板下送风与机柜前门的物理供给能力,冷热气流短路、局部热点不可避免;
- 噪音与能耗墙:暴力风扇转速拉满,风扇功耗可占整机 10% 以上,机房噪音远超职业健康标准;
- 芯片密度墙:单卡 TDP 已从 H100 的 700W 涨到 Rubin R200 的 1800-2300W——这个量级的芯片,散热器与芯片之间的空气层本身就是绝热层,风冷在物理上无法把 2000W 从 die 表面带走。
结论很直白:当单卡功耗突破千瓦级、机柜突破百千瓦级,液冷不再是选项,而是必需品。NVIDIA 对 Rubin R200 的官方口径就是四个字——必须液冷。
机柜功耗演进:五年 100 倍的狂飙
| 平台 | 机柜功耗 | 散热方式 |
|---|---|---|
| 传统服务器机柜 | 5-15 kW | 风冷 |
| GB300 NVL72 | ~140 kW | 液冷为主 |
| Vera Rubin NVL72(VR200) | ~190-230 kW | 全液冷 |
| Rubin Ultra NVL576 | ~600 kW | 全液冷 + 新一代供电 |
这条曲线(Thunder Compute 汇总口径)解释了为什么整个产业链都在围绕散热重构:机柜每上一个台阶,供配电、冷却水路、机房承重全部要重新设计。值得一提的是,散热还有"另一种解法"——华为昇腾 960 超节点用 NPO 光互连替代 4.8 万颗 800G 光模块,直接省下 550kW:最好的散热,有时是不产生这份热量。
技术梯队:冷板、浸没式与侧门冷却
液冷按冷却介质与发热元件的距离分为三档:
| 技术方案 | 原理 | 散热能力 | 改造成本 | 成熟度 |
|---|---|---|---|---|
| 冷板液冷 | 冷水板贴住 GPU/CPU 等高热元件 | 单柜 100-300kW | 中 | 主流量产方案 |
| 侧门冷却(Rear Door HX) | 机柜后门内置水冷换热器冷却排风 | 单柜 50-150kW | 低 | 过渡方案 |
| 浸没式液冷 | 整机浸入介电液体 | 极高,且可回收余热 | 高 | 特定场景试点 |
当前产业主流是冷板液冷:GPU、CPU 等热源元件用冷板覆盖,其余内存、硬盘仍靠风冷辅助,形成"液冷为主、风冷兜底"的混合形态。它的优势是可以在现有服务器形态上渐进改造,且不改变元器件可维护性。浸没式散热能力天花板最高、PUE 可逼近 1.05,但介电液体成本、服务器浸入后的可维护性与承重要求,使其仍局限于特定高密度场景。侧门冷却则是风冷机房"续命"的过渡选项。
50V 直流母线与液冷快速接头:工程细节里的魔鬼
散热革命从来不只是"换水冷板",它牵动整机柜的供电与水路重构。AMD Helios 机架的工程细节最具代表性:
- 44OU ORW 双宽机架:采用 Open Rack Wide v3 标准,机架宽度加倍,为 72 颗 MI455X + 18 颗 EPYC Venice 留出空间;
- 18 个计算托盘 + 6 个交换托盘:计算与网络托盘分层布置,托盘化设计让故障节点可整体抽出更换,水路随托盘断开;
- 液冷快速接头:每个托盘使用免工具快速接头,拔插自动密封不漏液——这是液冷能否规模化运维的关键:机房不可能为换一张卡而整体排水;
- 50V 直流母线:整机柜采用 50V 直流配电架构,替代传统多级 AC-DC 转换,减少变换级数、提升供电效率,与 NVIDIA 侧的 800V HVDC 演进方向殊途同归;
- 重量超 7000 磅(约 3.2 吨):装满冷却液与 72 颗 GPU 的机架对机房楼层承重提出全新要求,液冷机柜的"体重"本身就是部署约束。
Helios 机柜 TDP 225-245kW,与 Vera Rubin NVL72 的约 180kW 处在同一量级——头部厂商已默契地收敛到"百千瓦级液冷机柜 + 直流母线供电"的新范式。
功耗-散热-电力:三级约束链
机柜功耗狂飙的尽头是电网。当前 AI 数据中心面临一条层层传导的约束链:
芯片功耗 → 机柜散热能力 → 机房电力容量 → 区域电网供给。
- 电力缺口:部分新建数据中心等不及电网扩容——Oracle 用燃气卡车"运电"应急;戴尔与日本 Jera 合作投资 150 亿美元在东京建设 400MW 离网 AI 数据中心,自含燃气电厂,计划 2028 年运营。算力需求已快到"自己发电"的地步;
- 联盟与标准:AEMA(电网响应联盟)推动数据中心参与电网调峰响应;NVIDIA 则以 DSX 平台展示能效路线——同功率下 token 吞吐提升 24%、每瓦性能提升 23%,证明"省电"的最前沿其实在芯片与系统层;
- 散热的边界:每一瓦耗电最终都要变成一瓦热,被冷却系统搬运到室外。PUE(总耗电/IT 耗电)每降 0.1,就意味着数千千瓦的冷量系统节省——这也是为什么液冷的 ROI 不能只算电费。
三级约束环环相扣:电网约束机房选址,机房电力约束可部署机柜数,散热能力约束单机柜能塞进多少卡——最终都折算成你能买到的算力总量。
给部署方的建议
- 按液冷标准规划新机房:新建设施直接按 150kW+/机柜的液冷密度设计承重、水路与管井,避免两年后推倒重来;
- 冷板优先,浸没观望:冷板液冷生态与运维成熟度最高;浸没式适合高密度推理等特定负载,不建议作为通用方案首批落地;
- 关注直流供电架构:评估机柜级 50V 直流母线或更高压 HVDC 方案,转换级数越少,长期电费与可靠性收益越大;
- 把 PUE 纳入采购决策:本站的 TCO 计算器支持设置 PUE 参数,输入机柜功耗与 PUE 后即可模拟五年电费差异——液冷机柜贵出来的那部分钱,往往两三年内就会被电费差价抹平;
- 别忽略"减热"路线:光互连(如 NPO 省电 550kW)、更高能效芯片(每瓦性能提升 23% 的系统级优化)同样是散热压力的解药,买算力时把系统能效纳入比价。
小结
AI 机柜功耗从 100kW 冲向 600kW 的曲线,把散热从幕后推向台前。冷板液冷成为主流范式,50V 直流母线与快速接头定义了新一代机柜工程标准,而电网约束则把战场延伸到能源侧——燃气电厂进园区、调峰联盟成立、每瓦性能成为核心 KPI。未来的 AI 算力竞争,本质上是"每瓦 token"的竞争:谁能更高效地把电变成热、再把热搬走,谁就能部署更多算力。