Skip to main content

谷歌第八代 TPU 拆分战略:TPU 8t 主攻训练、TPU 8i 专精推理

· 8 min read
Industry Research Team

在 2026 年 4 月 22 日拉斯维加斯 Google Cloud Next '26 大会上,谷歌发布了第八代 TPU 的两款新品——训练专用的 TPU 8t 与推理优化的 TPU 8i。这是谷歌 TPU 家族诞生以来,第一次将训练与推理拆分至独立芯片。这一决策不仅重新定义了 TPU 的产品形态,也向整个 AI 算力行业释放了一个明确信号:训练与推理的工作负载特征已经分化到"一颗芯片通吃"不再经济的程度。

为什么要把训练和推理拆开​

传统上,TPU 一直走"一芯多用"路线——第七代 Ironwood 虽然以推理为主,但训练与推理仍在同一产品线上。而大模型进入智能体(Agentic AI)时代后,两种负载的差异被急剧放大:

  • 训练追求极限吞吐与集群扩展性,需要海量 HBM 容量、超高互联带宽,对单次推理延迟不敏感;
  • 推理则被成本、延迟和能效三重约束,KV Cache 读取、解码阶段的内存墙问题远比算力峰值更重要。

用同一颗芯片兼顾两者,必然在架构上互相妥协。谷歌选择彻底拆分:8t 的命名即"第 8 代 + training",8i 即"第 8 代 + inference"。谷歌基础设施负责人 Amin Vahdat 对此表态:"业界将受益于针对训练和推理各自需求专门优化的芯片。" CEO 皮查伊则从商业视角补充:谷歌要"以成本效益方式提供数百万智能体所需的大规模吞吐和低延迟"。

TPU 8t:训练专用,单 Pod 121 EFLOPS​

根据站内芯片卡数据,TPU 8t 的核心规格如下:

项目TPU 8t(训练专用)
制程TSMC 2nm
Die 设计双计算 Die
单芯片 FP4 算力12.6 PFLOPS
显存8× HBM3e 12 层(约 216GB)
HBM 带宽约 7 TB/s
Pod 规模9,600 芯片
Pod HBM 总量2 PB
Pod FP4 算力121 EFLOPS(约为 Ironwood 的 3 倍)
集成 CPUArm Axion(64 核 Neoverse V2)
TDP1,300 W
代工合作博通(Broadcom)
云端上线2026 H2

TPU 8t 有几个值得展开的架构要点。

其一,SparseCore 加速器。 8t 专门配备 SparseCore 处理嵌入查找(embedding lookup)带来的不规则内存访问模式——这正是 MoE 架构和推荐系统训练中最拖累 GPU 利用率的环节。站内卡显示其原生支持 Expert Parallel、1M+ token 长上下文训练以及 DPO/PPO/GRPO 等在线强化学习后训练范式。

其二,超大规模组网。 单 Pod 9,600 颗芯片经 ICI 3D Torus 与 Virgo 网络互联,单设施可扩展至 134,000 卡、跨站点扩展至 100 万卡以上,通过 JAX/Pathways 软件栈实现单集群超百万块 TPU 的协同训练。这意味着 Gemini 级别的 frontier 模型可以在单一 Pod 内完成训练。

其三,代际性能跃升。 谷歌官方口径是:同价格下 TPU 8t 性能达上代的 2.8 倍,每瓦性能提升 124%——训练侧的"每美元 token"经济学再次被改写。

TPU 8i:推理专精,384MB SRAM 加持​

TPU 8i 则把刀刃对准了推理成本。它的规格取向与 8t 截然不同:

项目TPU 8i(推理专用)
制程TSMC 2nm
核心设计双张量核心 + CAE(集合通信加速引擎)
片上 SRAM384 MB(Ironwood 的 3 倍)
显存288 GB HBM3e
Pod 规模1,152 芯片
Pod FP8 算力11.6 EFLOPS
性价比较 Ironwood 提升 80%
能效较 Ironwood 提升 117%
散热风冷 / 液冷均可
代工合作联发科(MediaTek,首次)

三个细节尤其关键。第一,384MB 片上 SRAM 大幅缓解长上下文 KV Cache 的内存墙,配合 CAE 将集合通信延迟降低 5 倍,KV Cache 可跨芯片共享。第二,288GB 单芯片显存是当前最大显存的推理 ASIC,FP16 下可完整装载 70B 模型。第三,风冷可选意味着不需要液冷机房也能部署,把推理集群的落地门槛大幅拉低。

Gemini API、Vertex AI 推理、Anthropic Claude on Vertex 的在线服务均面向 TPU 8i 设计。性能提升 80%、每瓦性能提升 117%,加上单美元算力比 Ironwood 高约 70% 的推测口径,8i 的目标非常直白:让"每百万 token 成本"继续下探。

两款芯片的镜像对比​

指标TPU 8t(训练)TPU 8i(推理)
核心设计双计算 Die双张量核心 + CAE
片上 SRAM—384 MB
Pod 芯片数9,6001,152
Pod 算力121 EFLOPS FP411.6 EFLOPS FP8
Pod HBM2 PB—
集成 CPUArm Axion无
散热第四代液冷风冷/液冷
代工博通联发科

一个耐人寻味的差异:只有 8t 集成了 Arm Axion CPU。训练节点需要 CPU 做海量数据预处理与加载,而推理节点的瓶颈在芯片内部,主机侧负担较轻。这也说明 Axion 集成并非营销噱头,而是精确的负载驱动设计。

Axion 集成:全栈协同的深层意图​

Arm Axion 是谷歌自研的 64 核 Neoverse V2 CPU。将其集成进 TPU 节点,意味着 TPU 不再是纯粹的"加速器",而是 TPU + CPU 协同的"超节点"——对标 NVIDIA 的 Vera CPU + Rubin GPU 组合。数据预处理、权重初始化、推理调度全部在节点内完成,消除了传统架构中主机 CPU 与加速器之间的数据搬运瓶颈。这是谷歌全栈(自研 CPU、自研 TPU、自研网络、自研框架)协同能力的集中体现。

与 NVIDIA 通用路线的分野​

谷歌的训练/推理拆分并非孤例。华为昇腾已经走出了同款路线——昇腾 950PR 面向训练、950DT 面向推理,同样是"代际相同、形态分化"。而 NVIDIA 至今坚持一颗 GPU 通吃训练与推理的通用路线,靠 CUDA 生态和 product segmentation(B 系列 / inference 专用 SKU)来分层。

两条路线的优劣可以放进一张表:

维度专用拆分(谷歌/华为)通用 GPU(NVIDIA)
单位成本效率各负载最优化,性价比更高存在为通用性付出的冗余
软件生态需维护两套工具链CUDA 一套通吃
客户灵活性训练/推理集群需分别采购一套集群弹性调度
演进节奏每条线独立迭代单一代际整体升级

对于自用负载极其明确的第一方厂商(谷歌、华为),拆分的经济性压倒一切;而 NVIDIA 面向的是千行百业的混合负载,通用性才是护城河。

TPU 生态的外溢:Google 之外正在成型​

还有一条容易被忽视的线索:TPU 正在从"谷歌内部资产"变成"开放生态"。前谷歌基础设施 VP Bikash Koley 跳槽至 TPU neocloud 创业公司 Crux AI——以 TPU 算力为核心商品、依托 Google Cloud 之外的基础设施提供云服务的商业层正在成型。加上 Anthropic 等重量级 TPU 大客户的存在,TPU 已经事实上成为 CUDA 之外最成熟的 AI 算力生态。两款芯片将于 2026 年晚些时候对外供应,届时 TPU 云市场的竞争格局值得持续观察。

小结​

TPU 8t 与 8i 的拆分,标志着 AI 算力竞争从"单芯片性能竞赛"进入"负载分化设计"的新阶段。训练芯片拼集群规模与吞吐,推理芯片拼每瓦、每美元与延迟——两种优化方向已经无法在单一架构内调和。谷歌用 TSMC 2nm、Axion 集成、SparseCore 与 CAE 给出了自己的答卷;华为昇腾的 PR/DT 双线则证明这不是孤立的赌注。对整个行业而言,2026 H2 这两款芯片正式对外供应后的市场反馈,将决定"训练/推理拆分"是否会成为下一代 AI 加速器的默认范式。