谷歌第八代 TPU 拆分战略:TPU 8t 主攻训练、TPU 8i 专精推理
在 2026 年 4 月 22 日拉斯维加斯 Google Cloud Next '26 大会上,谷歌发布了第八代 TPU 的两款新品——训练专用的 TPU 8t 与推理优化的 TPU 8i。这是谷歌 TPU 家族诞生以来,第一次将训练与推理拆分至独立芯片。这一决策不仅重新定义了 TPU 的产品形态,也向整个 AI 算力行业释放了一个明确信号:训练与推理的工作负载特征已经分化到"一颗芯片通吃"不再经济的程度。
为什么要把训练和推理拆开
传统上,TPU 一直走"一芯多用"路线——第七代 Ironwood 虽然以推理为主,但训练与推理仍在同一产品线上。而大模型进入智能体(Agentic AI)时代后,两种负载的差异被急剧放大:
- 训练追求极限吞吐与集群扩展性,需要海量 HBM 容量、超高互联带宽,对单次推理延迟不敏感;
- 推理则被成本、延迟和能效三重约束,KV Cache 读取、解码阶段的内存墙问题远比算力峰值更重要。
用同一颗芯片兼顾两者,必然在架构上互相妥协。谷歌选择彻底拆分:8t 的命名即"第 8 代 + training",8i 即"第 8 代 + inference"。谷歌基础设施负责人 Amin Vahdat 对此表态:"业界将受益于针对训练和推理各自需求专门优化的芯片。" CEO 皮查伊则从商业视角补充:谷歌要"以成本效益方式提供数百万智能体所需的大规模吞吐和低延迟"。
TPU 8t:训练专用,单 Pod 121 EFLOPS
根据站内芯片卡数据,TPU 8t 的核心规格如下:
| 项目 | TPU 8t(训练专用) |
|---|---|
| 制程 | TSMC 2nm |
| Die 设计 | 双计算 Die |
| 单芯片 FP4 算力 | 12.6 PFLOPS |
| 显存 | 8× HBM3e 12 层(约 216GB) |
| HBM 带宽 | 约 7 TB/s |
| Pod 规模 | 9,600 芯片 |
| Pod HBM 总量 | 2 PB |
| Pod FP4 算力 | 121 EFLOPS(约为 Ironwood 的 3 倍) |
| 集成 CPU | Arm Axion(64 核 Neoverse V2) |
| TDP | 1,300 W |
| 代工合作 | 博通(Broadcom) |
| 云端上线 | 2026 H2 |
TPU 8t 有几个值得展开的架构要点。
其一,SparseCore 加速器。 8t 专门配备 SparseCore 处理嵌入查找(embedding lookup)带来的不规则内存访问模式——这正是 MoE 架构和推荐系统训练中最拖累 GPU 利用率的环节。站内卡显示其原生支持 Expert Parallel、1M+ token 长上下文训练以及 DPO/PPO/GRPO 等在线强化学习后训练范式。
其二,超大规模组网。 单 Pod 9,600 颗芯片经 ICI 3D Torus 与 Virgo 网络互联,单设施可扩展至 134,000 卡、跨站点扩展至 100 万卡以上,通过 JAX/Pathways 软件栈实现单集群超百万块 TPU 的协同训练。这意味着 Gemini 级别的 frontier 模型可以在单一 Pod 内完成训练。
其三,代际性能跃升。 谷歌官方口径是:同价格下 TPU 8t 性能达上代的 2.8 倍,每瓦性能提升 124%——训练侧的"每美元 token"经济学再次被改写。
TPU 8i:推理专精,384MB SRAM 加持
TPU 8i 则把刀刃对准了推理成本。它的规格取向与 8t 截然不同:
| 项目 | TPU 8i(推理专用) |
|---|---|
| 制程 | TSMC 2nm |
| 核心设计 | 双张量核心 + CAE(集合通信加速引擎) |
| 片上 SRAM | 384 MB(Ironwood 的 3 倍) |
| 显存 | 288 GB HBM3e |
| Pod 规模 | 1,152 芯片 |
| Pod FP8 算力 | 11.6 EFLOPS |
| 性价比 | 较 Ironwood 提升 80% |
| 能效 | 较 Ironwood 提升 117% |
| 散热 | 风冷 / 液冷均可 |
| 代工合作 | 联发科(MediaTek,首次) |
三个细节尤其关键。第一,384MB 片上 SRAM 大幅缓解长上下文 KV Cache 的内存墙,配合 CAE 将集合通信延迟降低 5 倍,KV Cache 可跨芯片共享。第二,288GB 单芯片显存是当前最大显存的推理 ASIC,FP16 下可完整装载 70B 模型。第三,风冷可选意味着不需要液冷机房也能部署,把推理集群的落地门槛大幅拉低。
Gemini API、Vertex AI 推理、Anthropic Claude on Vertex 的在线服务均面向 TPU 8i 设计。性能提升 80%、每瓦性能提升 117%,加上单美元算力比 Ironwood 高约 70% 的推测口径,8i 的目标非常直白:让"每百万 token 成本"继续下探。
两款芯片的镜像对比
| 指标 | TPU 8t(训练) | TPU 8i(推理) |
|---|---|---|
| 核心设计 | 双计算 Die | 双张量核心 + CAE |
| 片上 SRAM | — | 384 MB |
| Pod 芯片数 | 9,600 | 1,152 |
| Pod 算力 | 121 EFLOPS FP4 | 11.6 EFLOPS FP8 |
| Pod HBM | 2 PB | — |
| 集成 CPU | Arm Axion | 无 |
| 散热 | 第四代液冷 | 风冷/液冷 |
| 代工 | 博通 | 联发科 |
一个耐人寻味的差异:只有 8t 集成了 Arm Axion CPU。训练节点需要 CPU 做海量数据预处理与加载,而推理节点的瓶颈在芯片内部,主机侧负担较轻。这也说明 Axion 集成并非营销噱头,而是精确的负载驱动设计。
Axion 集成:全栈协同的深层意图
Arm Axion 是谷歌自研的 64 核 Neoverse V2 CPU。将其集成进 TPU 节点,意味着 TPU 不再是纯粹的"加速器",而是 TPU + CPU 协同的"超节点"——对标 NVIDIA 的 Vera CPU + Rubin GPU 组合。数据预处理、权重初始化、推理调度全部在节点内完成,消除了传统架构中主机 CPU 与加速器之间的数据搬运瓶颈。这是谷歌全栈(自研 CPU、自研 TPU、自研网络、自研框架)协同能力的集中体现。
与 NVIDIA 通用路线的分野
谷歌的训练/推理拆分并非孤例。华为昇腾已经走出了同款路线——昇腾 950PR 面向训练、950DT 面向推理,同样是"代际相同、形态分化"。而 NVIDIA 至今坚持一颗 GPU 通吃训练与推理的通用路线,靠 CUDA 生态和 product segmentation(B 系列 / inference 专用 SKU)来分层。
两条路线的优劣可以放进一张表:
| 维度 | 专用拆分(谷歌/华为) | 通用 GPU(NVIDIA) |
|---|---|---|
| 单位成本效率 | 各负载最优化,性价比更高 | 存在为通用性付出的冗余 |
| 软件生态 | 需维护两套工具链 | CUDA 一套通吃 |
| 客户灵活性 | 训练/推理集群需分别采购 | 一套集群弹性调度 |
| 演进节奏 | 每条线独立迭代 | 单一代际整体升级 |
对于自用负载极其明确的第一方厂商(谷歌、华为),拆分的经济性压倒一切;而 NVIDIA 面向的是千行百业的混合负载,通用性才是护城河。
TPU 生态的外溢:Google 之外正在成型
还有一条容易被忽视的线索:TPU 正在从"谷歌内部资产"变成"开放生态"。前谷歌基础设施 VP Bikash Koley 跳槽至 TPU neocloud 创业公司 Crux AI——以 TPU 算力为核心商品、依托 Google Cloud 之外的基础设施提供云服务的商业层正在成型。加上 Anthropic 等重量级 TPU 大客户的存在,TPU 已经事实上成为 CUDA 之外最成熟的 AI 算力生态。两款芯片将于 2026 年晚些时候对外供应,届时 TPU 云市场的竞争格局值得持续观察。
小结
TPU 8t 与 8i 的拆分,标志着 AI 算力竞争从"单芯片性能竞赛"进入"负载分化设计"的新阶段。训练芯片拼集群规模与吞吐,推理芯片拼每瓦、每美元与延迟——两种优化方向已经无法在单一架构内调和。谷歌用 TSMC 2nm、Axion 集成、SparseCore 与 CAE 给出了自己的答卷;华为昇腾的 PR/DT 双线则证明这不是孤立的赌注。对整个行业而言,2026 H2 这两款芯片正式对外供应后的市场反馈,将决定"训练/推理拆分"是否会成为下一代 AI 加速器的默认范式。