Skip to main content

Agentic AI 正在重塑基础设施:从 token 到沙盒的新算力经济学

· 5 min read
Industry Research Team

聊天机器人时代,衡量算力的单位是 FLOPS 和 token/s。2026 年,随着企业 Agent 从"回答问题"转向"完成任务",一种新的计量单位开始流行——沙盒/秒。基础设施的每个环节,正在被这种新工作负载重新定价。

Agent 工作负载的"三高"​

Agent 与传统推理的本质区别在于它不是一次请求、一次回答,而是一个持续数十步的执行循环:每一步都要启动工具、运行代码、读写环境、反思结果。这给基础设施带来"三高"压力。

第一,高并发沙盒。Agent 执行任务需要隔离的代码执行环境,Daytona 在 2026 年 10 月 10 日发布的智能体基准显示:在 8×EPYC 9755 服务器上,基于 Vera CPU 的方案 10.8 秒即可上线 1000 个沙盒,峰值达 13.3 任务/秒,扩展到 2000 沙盒耗时 27.4 秒——沙盒的创建延迟,正在成为 Agent 平台的核心 SLO。第二,高频短请求。一个任务循环里包含大量短小的模型调用(工具选择、结果解析、路由判断),这类请求的 prefill 远大于 decode,与聊天场景的负载曲线完全不同。第三,大 KV Cache。Agent 会话动辄数十万 token,NVIDIA RTX Spark 甚至把 100 万 token 上下文作为桌面级卖点,长会话的 KV Cache 成了显存的最大消耗者。

机构口径显示,AI 推理的 token 消耗已达人类用户直接使用量的约 5 倍——机器与机器之间的对话,正在取代人与人之间的对话,成为算力的主要买家。

算力计量单位的变迁​

时代计量单位代表指标采购逻辑
训练为王FLOPS峰值算力比参数表
推理规模化token/s吞吐与延迟比单位 token 成本
Agent 时代沙盒/秒、任务/秒环境创建延迟、任务完成率比任务执行成本

这个变迁的深层含义是:采购决策从"买算力"变成"买任务完成能力"。Meta 的 Hatch 以每月 199.99 美元的价格出售自主 Agent(接入 DoorDash、Etsy、Reddit、Outlook),Google Cloud 的 Gemini 企业 Agent 强调"做工作而非答题",OpenAI 的 Presence 企业 Agent 进入有限 GA——定价单位都是"订阅/任务",倒推回基础设施层,就是沙盒密度与任务吞吐。

decode 阶段专用硬件的兴起​

Agent 循环里最伤延迟的不是 prefill,而是 decode——每一步的生成速度直接决定用户等待时间。NVIDIA 在 Vera Rubin 平台的七芯片堆栈里塞进了一颗非典型成员:Groq 3 LPX,定位是"专为智能体解码阶段设计的低延迟推理加速器"。这是 NVIDIA 第一次在旗舰平台里为 decode 单独配一颗 ASIC,与 Rubin GPU(管 prefill 和训练)形成分工。

逻辑不难理解:prefill 是算力受限,GPU 的 FLOPS 越多越好;decode 是带宽与延迟受限,堆 FLOPS 无济于事,需要的是针对逐 token 生成的访存优化。当 Agent 流量的 decode 占比持续上升,专用 decode 硬件就有了独立存在的经济学基础——正如当年推理从训练中拆分出来催生了推理 ASIC 一样,decode 正在从推理中再拆分出来。

上下文内存成为新基建​

Agent 的长会话必须能"暂停、保存、恢复"——用户中午发起的任务,Agent 下午继续执行时,几十万 token 的上下文不能重算。这催生了一层新基础设施:上下文内存。NVIDIA 把 BlueField-4 DPU 升级为推理上下文内存存储平台,宣称 token 吞吐最高提升 5 倍;华为同步发布 OceanStor M900 上下文内存存储集群,通过灵衢总线一跳直连,为昇腾超节点提供 PB 级 KV Cache,并把 SSD 读写寿命延长 16 倍。

Vera CPU 的高密度机架同样服务于这个趋势:单机架最大 256 颗 Vera CPU、支持同时运行超过 2.25 万个并发环境——CPU 不再只是 GPU 的陪衬,而是沙盒编排与上下文管理的专职引擎。

企业级门槛与采购建议​

Agent 进入企业还多了一层合规门槛:agent 身份(每个 Agent 是谁、权限多大)、操作日志(每一步做了什么)、回滚能力(出错如何撤销)。这些要求把"执行层"变成了强粘性资产——模型可以随时换,但嵌入业务流程的执行层一旦部署就很难被替换。这也解释了为什么企业 Agent 的竞争焦点从"回答质量"迅速转向"任务完成"。

给采购与架构师三条建议:第一,评估 Agent 平台时先看沙盒指标——创建延迟、并发密度、任务/秒,而不是 GPU 型号;第二,规划推理集群时预留上下文存储层,BlueField-4 类平台和 PB 级 KV 存储应当进采购清单;第三,关注 decode 专用硬件的落地节奏,LPX 这类组件可能重新划分推理服务器的内部配比。

小结​

Agentic AI 把算力经济学从"每 token 多少钱"推进到"每任务多少钱":高并发沙盒要求 CPU 密度,高频短请求要求 decode 专用硬件(Groq 3 LPX 是第一个信号),大 KV Cache 要求 PB 级上下文内存基建。Daytona 基准里 10.8 秒上线 1000 沙盒的成绩单,预示着"沙盒/秒"将成为下一轮基础设施比拼的通用语言。谁能把执行层做深、把上下文存好、把 decode 做快,谁就握住了 Agent 时代的入口。