Skip to main content

2026 推理 GPU 选型指南:Prefill/Decode 分离时代的卡怎么挑

· 6 min read
Industry Research Team

推理正在从"一张卡干所有活"走向"专用硬件干专项活"。Prefill 吃算力、Decode 吃带宽,这条基本规律正在重塑 2026 年的推理硬件市场——选型前先搞清楚你的负载属于哪一段。

一、推理负载画像:Prefill 与 Decode 是两件事​

一次大模型推理请求分两个阶段,瓶颈截然不同:

  • Prefill(预填充):把用户输入一次性算完,矩阵乘密集,是典型的 compute-bound 负载。算力(FP8/FP4)是瓶颈,显存带宽需求适中。
  • Decode(解码):逐 token 生成,每一步都要把全部权重和 KV Cache 从显存里读一遍,是典型的 memory-bound 负载。带宽决定吞吐,容量决定能塞下多长的上下文。

这条规律直接解释了 2026 年的两大产品趋势:昇腾把 950 拆成 950PR(Prefill 专用,1.4 TB/s 带宽)和 950DT(Decode + 训练,4 TB/s 带宽)两个版本;NVIDIA 收购 Groq 后,在 Vera Rubin 平台里给 LPU 留出正式位置——"GPU 管 Prefill,LPU 管 Decode"成为官方口径。

二、推理专用硬件成为趋势​

推理 ASIC 化是 2026 年最确定的产业方向:

  • Google TPU 8i / 8t:按推理与训练分拆的第八代 TPU,站内卡口径显示 2027 年底量产,仅通过 Google Cloud 按小时计费。
  • 昇腾 950PR / 950DT:同一 Da Vinci v5 计算核心配不同内存子系统。950PR 主攻 Prefill,FP4 算力 1.56 PFLOPS(Atlas 350 卡口径),112GB 自研 HiBL HBM;950DT 主攻 Decode,144GB HiZQ 2.0、带宽 4 TB/s。
  • NVIDIA Groq 3 LPX:每 LPU 500MB 片上 SRAM、片上带宽 150 TB/s;256 颗组成机架后聚合带宽 640 TB/s、算力 315 PFLOPS。实测 Gemma 4 31B 单用户 3,431 token/s,首 Token 延迟低于 20ms——这是 GPU 很难摸到的延迟量级。
  • OpenAI Jalapeño 等自研推理芯片:头部模型厂商自研推理 ASIC 的动作持续,推理负载的确定性让专用架构的性价比优势越来越难忽视。

结论:如果你的业务是千级并发的 Agent 调用,专用硬件已经从"可选项"变成"必选项"。

三、按场景推荐表​

场景推荐方案核心依据参考价格(站内定价库)
低延迟对话 / AgentGroq 3 LPX 机架;B300(FP4)LPX 首 Token < 20ms、单 Token < 5ms;B300 NVFP4 短输出吞吐较 H200 最高提升 20 倍LPX 机架推测 $800–1000 万/柜;B300 约 $52,000/卡
批量离线推理B300 / H200B300 FP8 口径吞吐 100,000+ tok/s,单 token 成本约为 H100 的 0.58 倍;H200 性价比稳健H200 市场价约 $38,000
长上下文 / 长文档H200 / B300 / Rubin R200H200 141GB 可单卡加载 70B 模型;B300 288GB 装 70B FP16 后仍余 100GB+ 给 KV Cache;Rubin 显存带宽 22 TB/sRubin 单卡预测价 $85,000
国产 / 边缘与低成本昇腾 950PR / 昆仑芯 R200 / 寒武纪思元690950PR 面向视频推荐与实时交互;R200 仅 150W、INT8 256 TOPS、108 路视频解码;思元690 196GB HBM3 容量大950PR 渠道价超 ¥8 万;思元690 约 ¥17.5 万;R200 未公开

场景之外还有两条通用原则:其一,Prefill 和 Decode 分离部署(P/D 分离)正在成为大厂标配,昇腾 950PR+950DT 的"异构推理流水线"就是为它设计的;其二,不要用训练卡凑合跑推理——训练卡的互联和精度配置是为反向传播优化的,推理场景下是花冤枉钱。

四、显存容量与 KV Cache:一笔必须先算的账​

模型权重之外,KV Cache 是推理显存的第二大占用,估算公式为:每 token 的 KV Cache = 2 × 层数 × KV 头数 × 每头维度 × 精度字节数。以主流 70B 级模型为例,FP16 权重约需 140GB,再叠加长上下文的 KV Cache 与激活值,就能解释选型表里的容量门槛:

  • 141GB 的 H200:刚够单卡装 70B FP16 + 有限上下文,官方口径即"70B+ 单卡加载"。
  • 288GB 的 B300:装完 70B FP16 后剩余 100GB+ 全部给 KV Cache,长上下文是它的主场。
  • 432GB 的 MI455X / 22 TB/s 的 Rubin R200:为超长上下文与多模型并存准备,MLPerf Inference v6.1 中 Rubin 的 Qwen3-VL 吞吐较 GB300 NVL72 最高提升 3.7 倍。

容量决定"能不能跑",带宽决定"跑多快"——Decode 阶段的吞吐几乎与显存带宽成正比,这就是为什么 4 TB/s 的昇腾 950DT 在长上下文生成场景能较 1.4 TB/s 的 950PR 提升约 2 倍。

五、成本视角:每 token 成本比每小时租金更重要​

比较推理硬件,正确指标是"每百万 token 的总成本",它是吞吐、卡价与电费的合力。以站内 B300 卡引用的 Llama 70B 云端实测为参照:

GPU吞吐量(tok/s)每 GPU·小时Token 成本(相对值)
H100 SXM约 21,800$2.001.0×(基准)
H200 SXM约 31,700$3.500.83×(省 17%)
B300(FP8)100,000+约 $8.000.58×(省 42%)
B300(FP4)150,000+约 $8.000.39×(省 61%)

结论很直白:B300 单价是 H100 的近两倍,但每 token 成本反而低四成以上。另一个常被忽略的变量是利用率——采购卡跑不满,单位成本会被空闲时间迅速摊薄。自建还是云租,取决于你的利用率曲线,这正是 TCO 测算要回答的问题。

不同方案的三年总成本差异,建议直接用站内 TCO 计算器 输入自己的利用率与电价实测;各卡的完整规格见完整对比表与对应芯片卡页面。

小结​

2026 年的推理选型可以压缩成三句话:先分清你的瓶颈在 Prefill 算力还是 Decode 带宽;延迟敏感的 Agent 场景认真评估 LPU 等专用硬件,吞吐敏感的批量场景看每 token 成本而不是卡价;显存先算 KV Cache 再谈容量,成本先算利用率再谈采购。Prefill/Decode 分离不是营销概念,而是每 token 经济学推导出的必然架构。