从 HBM2e 到 HBM4E:一文读懂 AI 显存的四代演进
大模型参数每 18 个月翻一番,GPU 算力每代翻 3-5 倍,而真正卡住 AI 芯片脖子的,往往是那圈贴在 GPU 旁边的"小方块"——HBM 高带宽显存。2026 年,HBM4 进入全面量产,HBM4E 已在路上,本文带你一次读懂四代演进的技术脉络。
HBM 是什么:把内存"竖起来"的 3D 堆栈
传统 GDDR 显存颗粒是平铺在 PCB 上的,走线长、寄生电感大,带宽天花板低。HBM(High Bandwidth Memory)的思路完全不同:
- 3D 堆栈:把 8 层甚至 12 层 DRAM 裸片垂直叠在一起,通过**微凸点(micro-bump)**层间互连;
- TSV 硅通孔:每层裸片打穿硅片形成垂直通路,让堆栈内部各层共享一条超宽的总线;
- 与 GPU 同封装:HBM 不再焊接在主板上,而是作为独立堆栈放在 GPU 同一个封装内,通过**硅中介层(interposer)**与 GPU 的 die 相连,走线距离从几十毫米缩短到毫米级。
这三件事叠加的结果是:接口位宽可以从 GDDR 的 32bit/颗粒跃升到每堆栈 1024bit 甚至 2048bit,带宽提升十倍以上。代价则是制造难度极高——TSV、堆叠键合、中介层封装每一环都是良率杀手。
四代 HBM 关键参数对比
| 代际 | 接口位宽 | 单堆栈带宽 | 单堆栈容量 | 典型层数 | 代表产品 |
|---|---|---|---|---|---|
| HBM2e | 1024bit | ~460 GB/s | 16-24 GB | 8 层 | H200、昇腾 910C |
| HBM3 | 1024bit | ~819 GB/s | 24 GB | 8-12 层 | H100 |
| HBM3e | 1024bit | ~1.15-1.2 TB/s | 24-36 GB | 8-12 层 | B200、MI355X |
| HBM4/4E | 2048bit | 2-2.8+ TB/s | 36 GB 起 | 12-16 层 | Rubin R200、MI455X |
以站内芯片卡的数据为参照:NVIDIA B200(Blackwell)配备 192GB HBM3e,带宽 8 TB/s;到 Rubin R200,8 颗 HBM4 堆栈带来 288GB 容量与 22 TB/s 带宽,带宽提升 2.75 倍。AMD MI455X 更激进,12 颗 36GB HBM4 堆栈做到 432GB / 23.3 TB/s。SK 海力士的 12 层 HBM4 单堆栈规格为 36GB、2.8 TB/s、11 Gbps 引脚速率,已于 2026 年 7 月量产出货。
为什么 2048bit 接口是分水岭
前三代 HBM 一直沿用 1024bit 接口,性能提升主要靠拉高引脚速率。这条路在 HBM3e 时代已经接近极限——信号完整性与功耗随速率平方增长,继续提速性价比骤降。
HBM4 做了一个根本性改动:接口位宽翻倍到 2048bit,而引脚速率只温和提升。以 Rubin R200 为例,单堆栈 2048bit 接口配合约 10.8 GT/pin 的引脚速率,即可得到约 2.7-2.8 TB/s 的堆栈带宽(与 SK 海力士单堆栈 2.8 TB/s 的规格吻合),8 颗堆栈合计正是 22 TB/s 的总带宽。SK 海力士单堆栈 2.8 TB/s 的成绩同样是"宽接口 + 适中速率"的结果。
位宽翻倍的意义在于:同样的数据量,需要的引脚速率更低、功耗更低、信号更稳。但它也带来新问题——堆栈与 GPU 之间的中介层走线密度翻倍,封装难度和成本水涨船高。HBM4 的竞争,本质上是封装能力的竞争。
HBM4E、12 层堆栈与 zHBM 展望
HBM4 的下一步是 HBM4E(Enhanced):
- 容量继续堆高:16 层堆栈将成为 HBM4E 主流,单堆栈容量迈向 48GB;
- 速率再上台阶:引脚速率从 HBM4 的 10+ Gbps 提升到 13-15 Gbps 区间;
- 三星入局:三星的 HBM4E 已通过 NVIDIA 验证,HBM 市场从 SK 海力士一家独大走向三强分食;
- zHBM 路线:三星还公布了 zHBM 概念——在 HBM 堆栈底部集成逻辑 die(Base Logic 加速器),把部分计算下沉到显存侧,探索"存算一体"式的近存计算,瞄准 HBM4E 之后的时代。
对整机厂而言,HBM4E 意味着单机柜显存总量再上台阶:Rubin 时代的 Vera Rubin NVL72 已有 20.7TB 总显存,Helios 机架(72 颗 MI455X)达 31TB,下一代翻倍几乎是定局。
HBM 定价权:三巨头最强时刻与国产涨价潮
2026 年是 HBM 厂商十年来话语权最强的时刻:
- 供不应求:三星、SK 海力士、美光的 HBM 产能已被预订到 2029 年,三大原厂议价能力空前;
- 成本传导:HBM 占 AI GPU 物料成本的比例从上一代的约 8% 攀升到 20% 以上,显存涨价直接推高整机价格;
- 国产涨价潮:外部 HBM 紧缺叠加国产需求爆发,昇腾系列报价显著上涨——昇腾 950PR 从年初约 6 万元涨破 8 万元(+30%),昇腾 950DT 指示性报价超过 25 万元,两个月内涨幅最高 50%。
涨价潮的根源不在芯片本身,而在 HBM:谁掌握显存供给,谁就掌握 AI 芯片的出货上限。
两条突围路线:自研 HBM 与定制 HBM
面对 HBM 瓶颈,产业界走出两条不同的路:
路线一:自研 HBM(华为)。 昇腾 950 系列首次采用华为自研 HBM——950PR 使用成本优先的 HiBL 1.0(128GB、1.6 TB/s),950DT 使用带宽优先的 HiZQ 2.0(144GB、4 TB/s),彻底摆脱对 SK 海力士和三星的依赖。自研 HBM 未必追求绝对性能领先,但解决了供应链"卡脖子"这一生死问题。
路线二:定制 HBM(NVIDIA)。 NVIDIA 推动与显存原厂合作开发 NVHBM——定制化堆栈,把 GPU 需要的接口逻辑直接做进 HBM 底部逻辑层,进一步压缩延迟、提高集成度。定制化意味着 GPU 厂商深度介入显存设计,原厂从"卖颗粒"升级为"卖方案"。
自研是供应链安全的答案,定制是性能极致的答案,两者将长期并存。
小结
四代 HBM 的演进主线非常清晰:HBM2e 到 HBM3e 在 1024bit 接口内"榨"速率,HBM4 用 2048bit 宽接口换回功耗与信号余量,HBM4E 与 zHBM 则在容量和架构上继续突破。显存已经从 GPU 的配角变成 AI 产业的核心资源——它决定带宽、决定成本、决定出货量,甚至决定各国 AI 算力的自主程度。看懂 HBM,才算真正看懂 AI 芯片的账本。