Skip to main content

HBM-DRAM-NAND 三层重构:KV Cache 如何改变存储金字塔

· 6 min read
Industry Research Team

过去十年,存储金字塔的分工非常清晰:HBM 伺候计算核心,DRAM 扛系统内存,NAND 做持久化。2026 年,Agentic AI 的 KV Cache 把这条界线搅得七零八落——上下文越来越长,显存越来越装不下,HBM-DRAM-NAND 三层正在被重新定义。

Agentic AI 的 KV Cache 问题​

传统聊天机器人的一次请求,上下文不过几千 token;而 Agent 的工作方式是在一个会话里连续执行几十步任务——浏览网页、读写文件、调用工具、自我反思——每一步都要携带完整的对话历史。上下文从 8K 涨到 100 万 token(NVIDIA RTX Spark 已支持最长 100 万 token 上下文),KV Cache 的体积也随之线性膨胀。

问题在于 KV Cache 必须常驻显存才能避免重复计算。以 Rubin R200 为例,它配备 288GB HBM4、带宽 22TB/s,看似充裕,但在多路并发服务时,模型权重占掉一块,剩余空间很快就会被活跃会话的 KV Cache 吃满。上一代 Blackwell Ultra(B300)之所以把显存从 192GB 提到 288GB HBM3e,官方场景里明确有一条就是"长上下文 KV Cache 288GB 完整保留"——显存的增长节奏,正在被 KV Cache 而不是模型参数牵着走。

当单卡显存装不下时,业界给出的答案是:别把 KV Cache 困在 HBM 里,让它沿着存储金字塔往下走。

三层金字塔:角色被重新定义​

Vera Rubin 平台是这场重构的最佳样本。它的"七芯片堆栈"包含 Vera CPU、Rubin GPU、NVLink 6 交换机、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 以太网交换机和 Groq 3 LPX,其中内存系统呈现清晰的三层结构:

层级介质代表硬件容量/带宽新角色
热数据层HBM4Rubin R200(8 堆栈)288GB / 22TB/s活跃 KV Cache、模型权重
温热数据层LPDDR5XVera CPU1.5TB / 1.2TB/sKV 缓存卸载、与 HBM 构成单一一致性内存池
冷数据层NAND(SSD)BlueField-4 驱动的推理上下文内存存储平台PB 级会话持久化与跨请求复用,token 吞吐最高提升 5 倍

关键变化有三点。其一,LPDDR5X 与 HBM4 之间建立了单一一致性内存池——Vera Rubin NVL72 机柜内,72 颗 GPU 共享 20.7TB HBM4,36 颗 Vera CPU 提供 54TB LPDDR5X,KV Cache 可以在不损失一致性语义的前提下在两层间流动。其二,BlueField-4 不再只是安全卸载卡,而是被定位为"推理上下文内存存储平台",把结束回合的会话上下文写入 NAND,下次请求命中时直接回灌,省去重新 prefill 的算力开销。其三,NAND 从"存储盘"升级为"上下文内存",这是金字塔底层几十年来第一次获得计算语义。

HBF、PIM、M900:案例对比表​

围绕这条三层链路,整个存储产业在 2026 年密集出招:

方案厂商技术要点目标场景
HBF(高带宽闪存)SK海力士(AI Infra Summit 2026 "New Spectrum" 组合)给 NAND 加上类 HBM 的超宽接口KV Cache 冷层,带宽接近 DRAM 量级
PIM 存内计算SK海力士在 DRAM 附近完成部分计算,减少搬运KV Cache 原地更新
eSSD + SALT-KVSK海力士面向 KV Cache 语义优化的键值存储栈推理上下文持久化
OceanStor M900华为上下文内存存储集群,灵衢总线一跳直连 PB 级 KV Cache,SSD 读写寿命延长 16 倍昇腾超节点的 KV 基建
NVHBM 定制内存AWS Annapurna × NVIDIA面向 AI 负载的定制 HBM 方案云厂商定制化
超密度服务器内存模组美光(2026-09-15)单模组容量再上一档DRAM 温热层扩容

SK海力士还专门设立了 SK hynix Ventures(9 月 18 日落地硅谷),用投资孵化初创公司的方式押注"内存即基础设施"这条新赛道。值得注意的是华为 OceanStor M900:它与昇腾 960 超节点同期发布,通过灵衢总线一跳直连,把 PB 级 KV Cache 集群变成超节点的"外挂记忆体",并通过磨损均衡等手段把 SSD 读写寿命延长 16 倍——上下文存储的写放大问题,第一次被当成显性的工程指标来攻克。

协同设计取代采购​

这轮重构背后,是产业关系的转向:存储不再是"按目录价采购的标准件",而是与加速器协同设计的定制组件。NVIDIA 联合 AWS Annapurna 做 NVHBM,华为为昇腾自研 HBM 并配套 OceanStor M900,SK海力士直接下场定义 KV 存储软件栈。美光甚至在 9 月的口径中预测 NAND 与 DRAM 短缺将持续到 2028 年——在供不应求的市场里,谁能锁定定制内存供给,谁就握住了推理产能。

对芯片厂商而言,算力竞争的上半场比的是 FLOPS,下半场比的将是"每 token 需要搬运多少字节"。带宽金字塔的每一层接口,都成了架构设计的一等公民。

对推理 TCO 的影响​

这套三层结构对成本模型的影响是直接的。第一,KV Cache 卸载到 DRAM 和 NAND 后,同样规模的 HBM 可以服务更多并发会话,单 token 的 HBM 摊销成本下降。第二,BlueField-4 上下文存储平台宣称 token 吞吐最高提升 5 倍,本质上是把重复 prefill 的 GPU 算力换成了廉价的 NAND 读取——用存储的"宽"换算力的"贵"。第三,内存已占整机 TCO 约 40%(HBM 涨价后的行业口径),存储分层做得越细,整体成本曲线越平缓。

小结​

KV Cache 正在把存储金字塔从"容量阶梯"改造成"温度阶梯":HBM 保活跃、DRAM 承接温热会话、NAND 做上下文持久化,三层之间以一致性内存池和专用存储平台(BlueField-4、OceanStor M900)贯通。SK海力士的 HBF/PIM/SALT-KV 与美光的超密度模组说明,存储大厂已经从跟随 AI 转向定义 AI 基础设施。下一阶段推理成本的胜负手,不在 GPU 的 FLOPS 表格上,而在三层存储之间的数据搬运路线上。