跳到主要内容

AI 算力 TCO 深度测算:3年总拥有成本的隐藏项

· 阅读需 6 分钟
Industry Research Team

报价单上的 GPU 单价,通常只占三年总拥有成本的一半左右。电费、机房、冷却、折现和一系列隐藏项,才是采购决策里真正拉开差距的部分。

一、TCO 的五大组件​

一台 AI 服务器的三年总拥有成本,可以拆成五个部分:

  1. 采购成本:GPU 卡 + 服务器节点 + 网络设备,一次性支出,不参与折现。
  2. 电费:设备电耗 × 使用小时数 × 电价,三年里最大的持续支出之一。
  3. 机房托管/租金:机柜租金或自建机房折算成本,按卡或按柜计费。
  4. 冷却:风冷机房里冷却电耗约为设备电耗的 30%,液冷机房可压到 10% 左右。
  5. 折现:未来三年的运营支出按年化折现率折算回今天的价值,让"三年合计"有可比性。

二、本站 TCO 计算器的默认口径​

为了让测算可复现,TCO 计算器采用了一套公开的默认口径:

  • 实际功耗:不按 TDP 满负荷计,而是按"实际功耗 = TDP ×(空闲比 +(1 − 空闲比)× 使用率)"计算,空闲功耗比例默认 15%。
  • 年电费:实际功耗 × 8760 小时 × 电价,电价默认 $0.1/kWh。
  • 冷却:冷却电费 = 设备电费 ×(PUE − 1)。PUE 默认 1.3(风冷),液冷可设 1.1,极致方案 1.05。注意冷却单独列示、不再重复乘 PUE,避免双重计算。
  • 折现:年化折现率默认 8%,按年末现金流口径折现;采购是一次性支出,永不折现。
  • 集群口径:默认每 8 卡配一台服务器节点(约 $30,000/台),网络设备按 GPU 采购价的 12% 估算,千卡级集群另计每年约 $15 万的人力 OPEX。
  • 汇率:人民币定价统一按 7.2 换算为美元。

三、实例测算:8 卡 B200 集群的三年 TCO​

以 B200 为例做一次文字推演。取站内卡口径:TDP 1,000W,市场价约 $42,000/卡;使用率取默认 90%,三年期。

一次性支出:GPU 采购 8 × $42,000 = $336,000;服务器节点 $30,000;网络设备按 12% 约 $40,300。合计约 $40.6 万。

年度运营:实际功耗 = 1kW × 8 ×(0.15 + 0.85 × 0.9)≈ 7.3kW;年设备电费 ≈ 7.3 × 8760 × $0.1 ≈ $6,400;冷却按 PUE 1.3 再加 30%,约 $1,900;机柜租金按 $500/卡·年 约 $4,000。年运营合计约 $12,300。

折现:8% 折现率下三年折现因子约 2.58,运营支出折现后约 $3.2 万。三年 TCO 约 $43.8 万(按 7.2 汇率约合 ¥315 万)——比单纯的采购价高出约三成,这还没算人力。拆成明细表更直观:

成本项口径金额(3年口径)
GPU 采购8 × $42,000(市场价)$336,000(一次性,不折现)
服务器节点8 卡 × 1 台$30,000(一次性)
网络设备GPU 采购价 × 12%约 $40,300(一次性)
设备电费7.3kW × 8760h × $0.1约 $6,400/年,折现后约 $16,500
冷却设备电 ×(PUE 1.3 − 1)约 $1,900/年,折现后约 $4,900
机柜租金$500/卡·年 × 8$4,000/年,折现后约 $10,300
合计—约 $43.8 万(≈¥315 万)

换成 Rubin R200 级别的旗舰方案,差距更夸张:单卡 TDP 1,800–2,300W 且必须液冷,NVL72 机柜功耗约 180kW,机柜定价 350–400 万美元。机柜电费按液冷 PUE 1.1 测算依然可观,这就是为什么"AI 工厂"的选址决策首先是电力决策。AMD MI455X 的 TDP 与定价均未公开,评估时建议按 Helios 机柜 225–245kW 的功耗上限做保守测算。

四、被忽略的隐藏成本​

公式之外的五类成本,最容易让预算失控:

  • HBM 涨价传导:2026 年 HBM 供应紧张直接推高卡价——昇腾 950DT 渠道价超 ¥25 万(两个月内涨 20%–50%)、950PR 突破 ¥8 万、寒武纪思元690 上调 20%–30%。今天入库的价格,明年可能就是另一回事;连二手 A100 市场价(约 $28,000)都已远超当年 $15,000 的指导价。
  • 供货周期:Rubin R200 自建机房用户要到 2027 年一季度才能采购,MI455X 规模爬坡要到 2026 下半年之后。等卡的每一天,都是空转的机柜租金。
  • 软件迁移:从 CUDA 迁到 ROCm 或 CANN,即便有兼容层(CANN Next 官方口径约 80% 的 PyTorch 代码仅需改配置),工程师时间和调优成本也要折算进 TCO。
  • 液冷改造:B300 Ultra TDP 1,400W 起就必须液冷,8 卡 DGX B300 峰值功耗约 14kW,相当于两台 H100 服务器。风冷机房升级液冷是一次性资本开支,很多预算模型里根本没这一项。
  • 电力增容:Helios 机柜 225–245kW、NVL72 约 180kW,数据中心级部署往往需要电力扩容审批,周期以月计。

五、云租 vs 自建:决策框架​

本站 TCO 计算器内置了 Build-vs-Rent 模型,核心结论可以用一个公式概括:自建的每 GPU·小时成本 = 固定成本 ÷ 利用率 + 变动电费。它意味着:

  • 利用率是分母:跑满的自建集群单位成本可能显著低于云价;利用率 30% 以下,自建几乎必然亏。公式还能解出盈亏平衡利用率——云价低于你的变动成本底线时,租赁恒优。
  • 云价参照系:默认云价 $2.5/GPU·小时;实际行情中 H100 约 $2.00,B300 约 $8.00。拿你的负载画像去对号入座。
  • 决策规则:稳定高负载(利用率 70% 以上)倾向自建;波动或探索期负载先云租;介于两者之间的,用计算器输入真实电价、租金和利用率跑一遍敏感性分析(电价 +20%、使用率 +20%、PUE 1.5 等情景)再做决定。

小结​

TCO 测算的价值不在于算出一个精确数字,而在于把"采购价幻觉"拆掉:一次性支出只占三年成本的一半到三分之二,电费与冷却跟随功耗走,折现让远期支出显形,而 HBM 涨价、供货周期、液冷改造这些隐藏项往往才是超预算的元凶。建议打开站内 TCO 计算器,用自己的参数实测一遍;型号规格可查阅完整对比表与各芯片卡页面。