AI 算力 TCO 深度测算:3年总拥有成本的隐藏项
报价单上的 GPU 单价,通常只占三年总拥有成本的一半左右。电费、机房、冷却、折现和一系列隐藏项,才是采购决策里真正拉开差距的部分。
一、TCO 的五大组件
一台 AI 服务器的三年总拥有成本,可以拆成五个部分:
- 采购成本:GPU 卡 + 服务器节点 + 网络设备,一次性支出,不参与折现。
- 电费:设备电耗 × 使用小时数 × 电价,三年里最大的持续支出之一。
- 机房托管/租金:机柜租金或自建机房折算成本,按卡或按柜计费。
- 冷却:风冷机房里冷却电耗约为设备电耗的 30%,液冷机房可压到 10% 左右。
- 折现:未来三年的运营支出按年化折现率折算回今天的价值,让"三年合计"有可比性。
二、本站 TCO 计算器的默认口径
为了让测算可复现,TCO 计算器采用了一套公开的默认口径:
- 实际功耗:不按 TDP 满负荷计,而是按"实际功耗 = TDP ×(空闲比 +(1 − 空闲比)× 使用率)"计算,空闲功耗比例默认 15%。
- 年电费:实际功耗 × 8760 小时 × 电价,电价默认 $0.1/kWh。
- 冷却:冷却电费 = 设备电费 ×(PUE − 1)。PUE 默认 1.3(风冷),液冷可设 1.1,极致方案 1.05。注意冷却单独列示、不再重复乘 PUE,避免双重计算。
- 折现:年化折现率默认 8%,按年末现金流口径折现;采购是一次性支出,永不折现。
- 集群口径:默认每 8 卡配一台服务器节点(约 $30,000/台),网络设备按 GPU 采购价的 12% 估算,千卡级集群另计每年约 $15 万的人力 OPEX。
- 汇率:人民币定价统一按 7.2 换算为美元。
三、实例测算:8 卡 B200 集群的三年 TCO
以 B200 为例做一次文字推演。取站内卡口径:TDP 1,000W,市场价约 $42,000/卡;使用率取默认 90%,三年期。
一次性支出:GPU 采购 8 × $42,000 = $336,000;服务器节点 $30,000;网络设备按 12% 约 $40,300。合计约 $40.6 万。
年度运营:实际功耗 = 1kW × 8 ×(0.15 + 0.85 × 0.9)≈ 7.3kW;年设备电费 ≈ 7.3 × 8760 × $0.1 ≈ $6,400;冷却按 PUE 1.3 再加 30%,约 $1,900;机柜租金按 $500/卡·年 约 $4,000。年运营合计约 $12,300。
折现:8% 折现率下三年折现因子约 2.58,运营支出折现后约 $3.2 万。三年 TCO 约 $43.8 万(按 7.2 汇率约合 ¥315 万)——比单纯的采购价高出约三成,这还没算人力。拆成明细表更直观:
| 成本项 | 口径 | 金额(3年口径) |
|---|---|---|
| GPU 采购 | 8 × $42,000(市场价) | $336,000(一次性,不折现) |
| 服务器节点 | 8 卡 × 1 台 | $30,000(一次性) |
| 网络设备 | GPU 采购价 × 12% | 约 $40,300(一次性) |
| 设备电费 | 7.3kW × 8760h × $0.1 | 约 $6,400/年,折现后约 $16,500 |
| 冷却 | 设备电 ×(PUE 1.3 − 1) | 约 $1,900/年,折现后约 $4,900 |
| 机柜租金 | $500/卡·年 × 8 | $4,000/年,折现后约 $10,300 |
| 合计 | — | 约 $43.8 万(≈¥315 万) |
换成 Rubin R200 级别的旗舰方案,差距更夸张:单卡 TDP 1,800–2,300W 且必须液冷,NVL72 机柜功耗约 180kW,机柜定价 350–400 万美元。机柜电费按液冷 PUE 1.1 测算依然可观,这就是为什么"AI 工厂"的选址决策首先是电力决策。AMD MI455X 的 TDP 与定价均未公开,评估时建议按 Helios 机柜 225–245kW 的功耗上限做保守测算。
四、被忽略的隐藏成本
公式之外的五类成本,最容易让预算失控:
- HBM 涨价传导:2026 年 HBM 供应紧张直接推高卡价——昇腾 950DT 渠道价超 ¥25 万(两个月内涨 20%–50%)、950PR 突破 ¥8 万、寒武纪思元690 上调 20%–30%。今天入库的价格,明年可能就是另一回事;连二手 A100 市场价(约 $28,000)都已远超当年 $15,000 的指导价。
- 供货周期:Rubin R200 自建机房用户要到 2027 年一季度才能采购,MI455X 规模爬坡要到 2026 下半年之后。等卡的每一天,都是空转的机柜租金。
- 软件迁移:从 CUDA 迁到 ROCm 或 CANN,即便有兼容层(CANN Next 官方口径约 80% 的 PyTorch 代码仅需改配置),工程师时间和调优成本也要折算进 TCO。
- 液冷改造:B300 Ultra TDP 1,400W 起就必须液冷,8 卡 DGX B300 峰值功耗约 14kW,相当于两台 H100 服务器。风冷机房升级液冷是一次性资本开支,很多预算模型里根本没这一项。
- 电力增容:Helios 机柜 225–245kW、NVL72 约 180kW,数据中心级部署往往需要电力扩容审批,周期以月计。
五、云租 vs 自建:决策框架
本站 TCO 计算器内置了 Build-vs-Rent 模型,核心结论可以用一个公式概括:自建的每 GPU·小时成本 = 固定成本 ÷ 利用率 + 变动电费。它意味着:
- 利用率是分母:跑满的自建集群单位成本可能显著低于云价;利用率 30% 以下,自建几乎必然亏。公式还能解出盈亏平衡利用率——云价低于你的变动成本底线时,租赁恒优。
- 云价参照系:默认云价 $2.5/GPU·小时;实际行情中 H100 约 $2.00,B300 约 $8.00。拿你的负载画像去对号入座。
- 决策规则:稳定高负载(利用率 70% 以上)倾向自建;波动或探索期负载先云租;介于两者之间的,用计算器输入真实电价、租金和利用率跑一遍敏感性分析(电价 +20%、使用率 +20%、PUE 1.5 等情景)再做决定。
小结
TCO 测算的价值不在于算出一个精确数字,而在于把"采购价幻觉"拆掉:一次性支出只占三年成本的一半到三分之二,电费与冷却跟随功耗走,折现让远期支出显形,而 HBM 涨价、供货周期、液冷改造这些隐藏项往往才是超预算的元凶。建议打开站内 TCO 计算器,用自己的参数实测一遍;型号规格可查阅完整对比表与各芯片卡页面。