跳到主要内容

2026 训练 GPU 选型指南:从 H100 到 Rubin,预算百万到亿级怎么选

· 阅读需 6 分钟
Industry Research Team

训练选型的本质不是"买最强的",而是在预算、负载规模、软件生态和供货确定性之间找到平衡点。本文数据均取自本站芯片卡与定价库,帮你按预算分档做出决策。

一、先分级:你的训练负载属于哪一档​

训练负载大致分为三档,档位不同,选型逻辑完全不同:

  • 微调 / LoRA:单卡或 8 卡即可完成,7B–70B 模型为主。瓶颈在显存容量与单卡带宽,互联要求低,PCIe 机型甚至二手卡都能胜任。
  • 继续预训练 / 领域适配:数百卡规模,需要稳定的多卡互联与成熟的软件栈,容错与断点续训能力开始重要。
  • 从零预训练:千卡乃至万卡集群,互联带宽、机架方案(NVL72、Helios、CloudMatrix)和集群软件效率决定成败,预算通常以千万美元计。

二、按预算分档推荐​

预算档位推荐方案关键规格参考单价(站内定价库)
入门微调(数十万元级)H100 SXM / H200BF16 1,979 TFLOPS(稀疏)、80GB / 141GB HBM3e、NVLink 900 GB/s、700W 风冷H100 市场价约 $28,000;H200 约 $38,000
中等规模(数百万元级)B200 / AMD MI355XB200:192GB HBM3e、FP8 10 PFLOPS(稀疏)、NVLink 1.8 TB/s;MI355X:288GB HBM3E、FP8 dense 5 PFLOPS、UALink 600 GB/sB200 约 $42,000;MI355X 官方指导价 $22,000
旗舰预训练(千万到亿级)B300 Ultra / Rubin R200 / MI455XB300:288GB HBM3e、FP8 dense 7 PFLOPS;Rubin:288GB HBM4、22 TB/s、NVLink 6 3.6 TB/s;MI455X:432GB HBM4、23.3 TB/s、MXFP4 40.3 PFLOPSB300 约 $52,000;Rubin NVL72 机柜 350–400 万美元;MI455X 定价未公开(Helios 机柜约 500–550 万美元)
国产合规档昇腾 910C / 昇腾 950DT / 寒武纪思元690910C:BF16 800 TFLOPS、128GB HBM2e;950DT:FP8 约 1 PFLOPS、144GB 自研 HiZQ 4 TB/s;思元690:FP16 700+ TFLOPS、196GB HBM3910C 渠道价超 ¥11 万;950DT 超 ¥25 万;思元690 约 ¥17.5 万

几个要点值得展开:

  • 入门档首选 H100/H200 并不落伍。H100 的 BF16 稀疏算力 1,979 TFLOPS、700W TDP 风冷友好,生态最成熟;H200 显存加到 141GB、带宽 4.8 TB/s,微调 70B 级模型更从容。
  • 中等规模档 B200 与 MI355X 各有侧重。MI355X 用 288GB HBM3E 和 3nm 制程在显存容量上压过 B200,官方口径 FP8 dense 5 PFLOPS 也略胜,价格还便宜约四成;但 B200 的 NVLink 1.8 TB/s 是 UALink 600 GB/s 的三倍,千卡扩展时差距会显现。
  • 旗舰档看机架而不是单卡。B300 Ultra 必须液冷(TDP 1,400W),Rubin R200 的 Vera Rubin NVL72 机柜 FP4 算力约 3.6 EFLOPS、总显存 20.7TB;MI455X 的 Helios 机架 72 卡 31TB HBM4、机柜功耗 225–245kW。这一档的采购单位是"机柜",还要配套液冷与供电改造。

三、关键参数怎么读​

  • FP16/BF16 算力:注意 dense 与 sparse 口径差一倍。H100 的 1,979 TFLOPS 是稀疏值,dense 约 989 TFLOPS;比较时务必统一口径。
  • 显存容量:从 H100 的 80GB 到 B300 的 288GB 再到 MI455X 的 432GB,容量决定了能训多大模型、能开多大 batch。训练 70B 模型 FP16 权重本身就要约 140GB,加上优化器状态后通常需要多卡切分。
  • 互联带宽:NVLink 4.0(900 GB/s)→ NVLink 5(1.8 TB/s)→ NVLink 6(3.6 TB/s);AMD 走开放路线的 UALink 600 GB/s;昇腾为 HCCS 784 GB/s 与灵衢 2 TB/s。张量并行通信密集,互联带宽直接决定扩展效率。
  • 机架方案:GB200/GB300 NVL72、Helios、CloudMatrix 384 是三家给出的系统级答案。单卡强不等于集群强,采购前要确认整机柜方案、网络与液冷的完整交付能力。

四、软件生态权重:CUDA vs ROCm vs CANN​

  • CUDA:十八年积累,算子覆盖最全,从 H100 到 Rubin 全线兼容,迁移成本最低。
  • ROCm:AMD 官方口径承认成熟度仍落后 CUDA 约 2–3 年,但开放生态对云厂商和主权 AI 项目有吸引力,MI355X/MI455X 的客户名单里已有 Microsoft Azure、Meta、Oracle 等。
  • CANN:昇腾 950 系列配套 CANN Next 提供 CUDA 兼容层,约 80% 的标准 PyTorch 代码仅需配置修改即可迁移;2026 年 10 月 DeepSeek 与华为还联合发布了面向昇腾 950 的开源编程工具与库。

经验法则是:微调档闭眼选 CUDA;中等规模档如果显存需求突出、团队有 ROCm 经验,MI355X 值得评估;合规档则要在选型时就把迁移人力写进预算。

五、供货与价格现实​

2026 年的选型绕不开 HBM:

  • 涨价传导:HBM 成本攀升直接推高国产卡报价——昇腾 950DT 渠道指示价已超 ¥25 万(较两个月前上涨 20%–50%),昇腾 950PR 突破 ¥8 万,寒武纪等同期上调 20%–30%。
  • 云租是一条现实路径:H100 云租约 $2.00/GPU·小时,B200 约 $5.87/GPU·小时,B300 的 AWS 8 卡实例约 $11.70/GPU·小时(Nebius 口径约 $9.50/GPU·小时)。训练周期短的项目,租往往比买划算。
  • 旗舰卡要排队:Rubin R200 已于 2026 年 6 月全面量产,但自建机房用户要到 2027 年一季度才能采购;MI455X 也需到 2026 年下半年至 2027 年上半年才规模爬坡。急用算力,H100/H200/B200 的现货市场仍是主力。

想逐项对比更多型号(包括 Google TPU、Intel Gaudi 4、百度昆仑芯等),请查看站内完整对比表;每张卡的详细规格可进入对应芯片卡页面查看。

小结​

2026 年的训练 GPU 市场第一次出现了"四条路线":CUDA 旗舰(Rubin/B300)、开放生态(MI355X/MI455X)、推理专用硬件和国产合规方案。选型的顺序应该是:先定负载档位,再按预算筛卡,然后核算互联与机架方案,最后把软件迁移和供货周期计入总成本。单卡峰值参数只讲了一半的故事,剩下的另一半在集群和生态里。