Skip to main content

15 posts tagged with "AI Compute"

AI compute supply, demand and industry trends

View all tags

AI 芯片周报(2026年第42周):Gorgon Halo、千亿投资 OpenAI 与算力金融化

· 5 min read
Industry Research Team

2026年第42周(10月6日—10月10日),AI 芯片行业的关键词是"下沉"与"金融化":AMD 把 192GB 内存塞进 AI PC,NVIDIA 承诺最高 1000 亿美元投资 OpenAI,三星单季利润预计暴增 8 倍,高盛统计年内 AI 财团融资约 5000 亿美元。本篇按国际、国产、存储与系统、资本与市场四节汇总。

国际动态​

AMD 发布 Ryzen AI Max 400 "Gorgon Halo":最高 192GB 统一内存,覆盖 Pro 495/490/485 三个型号,单机可离线运行 1000 亿参数级大模型(官方口径支持 300B 级量化部署),在 NVIDIA RTX Spark 新品活动前两天发布,正面竞争意图明显。

NVIDIA 承诺最高 1000 亿美元投资 OpenAI:双方协议锚定 10GW 部署规模,首个 1GW 基于 Rubin 平台,计划 2026 H2 上线。芯片厂商向客户注资、客户用投资采购芯片的"循环"结构,成为本周算力金融化的标志性样本。

微软双线出击:Surface Laptop Ultra 发布($2,599,10 月 16 日发货),同期 DGX Station for Windows 开启预览——GB300 平台、748GB 统一内存、20 PFLOPS FP4。RTX Spark 笔记本预订同步开启,联想 YOGA Pro 15 RTX Spark 定档 10 月 16 日开售。

Daytona 基准新纪录:基于 Vera 平台的系统以 8×EPYC 9755 配置实现 10.8 秒创建千级沙盒,Agent 基础设施的启动时延被压缩到秒级。

事件厂商要点
Gorgon Halo 发布AMD192GB、Pro 495/490/485
千亿投资 OpenAINVIDIA10GW、首 GW Rubin 2026 H2
Surface Laptop Ultra微软$2,599、10-16 发货
Daytona 千沙盒 10.8 秒Vera 平台8×EPYC 9755

国产动态​

徐直军 HC2026 访谈给出三个关键口径:昇腾 950DT 年底实现规模供货;按华为口径昇腾在中国市场份额已超英伟达;当前第一约束是产能而非需求。结合站内 950 规格卡的市场报价数据(950DT 指示性报价超 25 万元、两月涨幅最高 50%),供给紧张可见一斑。

壁仞科技拟配售 1.3 亿股 H 股:配售价 31.08 港元,较市价折让 9.76%,国产 GPU 上市公司密集利用窗口期补充研发弹药。

奕行智能完成近 20 亿元融资:估值接近 150 亿元,边缘与推理芯片赛道持续吸金。

存储与系统​

三星 Q3 业绩预告炸裂:利润预计超 100 万亿韩元、同比增约 8 倍;12 层 HBM4E 已通过 NVIDIA 验证;同步公布 zHBM 与 400 层 V10 NAND 路线图。HBM 验证通过意味着 Rubin 后续代的存储供应格局进一步固化。

DRAM 价格创 15 年新高:本季度最高涨幅达 89%,内存占整机 TCO 比重持续攀升——站内 Rubin Ultra 卡记录的"内存已占 TCO 约 40%"正在被进一步刷新。

GlobalFoundries 与 TSMC 签订 20 亿美元 interposer 协议:先进封装产能成为继 HBM 之后又一个被提前锁定的环节。

Oracle 燃气卡车运电:据 Bloomberg 确认,Oracle 用卡车运送天然气维持多座数据中心运转,电力短缺已从预测变为运营现实。

资本与市场​

高盛统计:年内 AI 财团融资约 5000 亿美元。算力投资已形成"芯片商注资-客户采购-算力转售"的金融化闭环。

GMI Cloud 融资 6.68 亿美元,其中含 NVIDIA 2.23 亿美元股权投资——NVIDIA 的注资版图从中大型云厂商延伸到新兴算力运营商。

Super Micro 出口管制案同谋认罪,供应链合规风险开始向整机厂传导。

TSMC Q3 营收创纪录:9 月营收同比 +54.6%,全年 CAPEX 顶格至 560 亿美元,先进制程与先进封装双线扩产。

NVIDIA 计划投资 d-Matrix,推理 ASIC 新贵获得巨头背书;Upscale AI 发布 Token Fabric 网络方案;Gemini 4 "Argon" 即将发布,模型侧的新一代旗舰同样在倒计时。

下周关注​

  1. RTX Spark 笔记本 10 月 16 日首发:Surface Laptop Ultra 与联想 YOGA Pro 15 同日开售,首发实测数据与终端定价即将揭晓;
  2. 昇腾 950DT 规模供货节奏:徐直军"年底规模供货"承诺进入兑现观察期;
  3. Q3 财报季开启:TSMC 已开 SCE 头炮,存储三巨头与 GPU 供应链财报将密集落地;
  4. Rubin NVL72 出货爬坡:首个 1GW Rubin 部署能否如期在 2026 H2 上线。

小结​

第 42 周的主线是"算力金融化":NVIDIA 千亿美元投资 OpenAI、高盛统计的 5000 亿财团融资、三星 8 倍利润,共同指向一个事实——AI 算力已经从技术生意变成资本生意。与此同时,Gorgon Halo 与 Surface Laptop Ultra 的发布说明竞争正在向端侧下沉,而 DRAM 创 15 年新高、Oracle 运气运电则提醒所有人:上游的存储与电力约束,比任何发布会都更真实地决定着 2027 年的算力供给。

EPYC Venice 256核登陆 2nm:AMD 服务器 CPU 的 AI 时代打法

· 6 min read
Industry Research Team

在 AI GPU 抢走所有头条的年代,服务器 CPU 的战争并未结束,而是换了一种打法。AMD 把 Zen 6 架构的 EPYC Venice 推上 2nm,堆到 256 核,并让它成为 Helios 机架的主机侧大脑——这是一份关于"AI 时代 CPU 该干什么"的答案。

全球首款 2nm 数据中心 CPU​

EPYC Venice 于 2026 年 1 月 6 日在 CES 发布,是第六代 EPYC 数据中心处理器,也是全球首款采用 2nm 工艺的高性能处理器。苹果会在消费级处理器上首发台积电 2nm,但数据中心 2nm 的头衔属于 AMD——在 x86 阵营中,这是自 Zen 架构崛起以来 AMD 第一次在制程节点上同时领先所有对手。

其核心规格如下:

规格参数
CPU 架构Zen 6 / Zen 6C
制程工艺台积电 2nm(N2)
核心数量最高 256 核(Zen 6C 版)
线程数量最高 512 线程
L3 缓存1024MB(1GB)
CCD 配置8 个 Zen 6C CCD(每 CCD 32 核)
内存通道16 通道,单路带宽 1.6TB/s
PCIe6.0
封装接口全新 SP7
发布时间2026 年 1 月 6 日(CES 2026)
量产时间2026 年 5 月(已投入量产)

Venice 系列包含两个版本:高密度 Zen 6C 版本最高 256 核(8 个 CCD、每 CCD 32 核、1GB L3),面向高密度数据中心;标准 Zen 6 版本最高 192 核(16 个 CCD、每 CCD 12 核、768MB L3),面向通用数据中心。单核性能提升达 70%。

256 核的密度哲学:AI 节点中 CPU 的角色重定义​

Zen 6C 的设计哲学浓缩在一个数字里:每 CCD 32 核,比上代 Zen 5C 的 16 核直接翻倍。这让 AMD 只用 8 颗 CCD 就实现了 256 核——更少的芯粒数量意味着更低的封装成本、更简化的互联拓扑与更好的良率控制。这是典型的 chiplet 时代密度打法:不追求单核极限,而是追求单位封装面积与单位成本下的核心密度。

为什么 AI 数据中心需要 256 核?答案藏在 CPU 角色的转变里。在传统数据中心,CPU 是绝对主角;而在 Helios 这样的 AI 机架中,每托盘 4 颗 MI455X GPU 配 1 颗 Venice,CPU 的职责变成了数据搬运、内存管理、系统控制编排——它不再是算力的提供者,而是算力的"交通调度员"。

这个角色对 CPU 的要求恰好与 256 核匹配:数据预处理、Tokenization、KV Cache 管理、网络协议栈、存储 I/O,这些工作高度并行且不依赖单核性能,核心数量就是吞吐量。16 通道内存提供的 1.6TB/s 带宽(Turin 的 2 倍)与升级的 PCIe 6.0、CPU-GPU 互联带宽翻倍,都是为了同一个目标:让 GPU 永远不缺数据。在 AI 工厂里,一颗喂不饱 GPU 的 CPU,就是最贵的瓶颈。

2nm 双厂布局:台湾与亚利桑那的地缘对冲​

Venice 的另一个关键进展是产能布局:它已在台积电 2nm 产线启动量产,并将延伸至台积电美国亚利桑那工厂。这使 AMD 成为首个实现美国本土 2nm 量产的 x86 服务器 CPU 厂商。

这步棋的价值在地缘层面。美国政府对本土先进制程产能的战略诉求日益强烈,超大规模云厂商的采购决策中"美国制造"的权重持续上升;亚利桑那产线让 AMD 在满足主权 AI 与政府订单时拥有对手难以复制的选项。与此同时,台湾产线保障了主力产能与成本效率——双厂并行既是对冲地缘风险,也是对冲单一产线的产能与意外风险。对于一款要装进 OpenAI、Meta、微软数 GW 级 AI 工厂的 CPU,供应链韧性本身就是产品力。

竞争格局:Intel 的份额流失与 Vera 的正面压力​

服务器 CPU 市场的竞争压力来自两个方向。

一个方向是传统对手 Intel。分析师普遍认为 Intel 在服务器 CPU 市场持续丢失份额,甚至出现"卖出 Intel"的分析口径。在 AI 数据中心的建设热潮中,每新建一个机架,主机侧 CPU 的采购决策就发生一次——而 Helios 这类 AMD 自家机架方案,天然把 Venice 带进了原本属于 Xeon 的领地。

另一个方向来自 NVIDIA。AI 工厂正在重新定义 CPU 的形态:NVIDIA 为 Rubin 平台配套了自研的 Vera ARM CPU(88 核),试图用"GPU 加自家 CPU"的整合方案替代独立服务器 CPU。竞争压力已经有数字化的呈现——根据 Daytona 的 Vera CPU 智能体基准测试,Vera 在千个沙盒场景中耗时 10.8 秒,而 EPYC 9755 需要 88.4 秒。这一测试虽不能代表所有负载,但它揭示了一个真实趋势:NVIDIA 正在用专为 AI Agent 工作负载设计的 CPU 架构,向"AI 工厂该用什么 CPU"的话语权发起冲击。

AMD 的应对是把 Venice 做成开放生态的一部分:它不只服务 Helios,也通过 Dell、HPE、Supermicro、Lenovo 的 OEM 渠道进入各种第三方 AI 服务器。与 Vera 的封闭整合路线不同,Venice 的卖点是 x86 软件兼容性与部署灵活性——存量数据中心不需要重写一行代码。

小结​

EPYC Venice 的故事不是"更多核心、更先进制程"的常规升级,而是一次角色转型的样板:CPU 从数据中心的主角变成 AI 工厂的调度中枢,256 核与 1.6TB/s 内存带宽是为"数据搬运工"这个新岗位定制的装备。2nm 双厂布局提供了地缘对冲,x86 兼容性守住了开放生态的基本盘。它面对的挑战同样明确——向上要顶住 Vera 这类 AI 原生 CPU 架构的挤压,向下要继续收割 Intel 丢失的份额。AI 时代的 CPU 战争,才刚刚进入下半场。

GB300 Grace Blackwell Ultra 全解:从 20 PFLOPS 桌面超算到数据中心旗舰

· 6 min read
Industry Research Team

同一颗 GB300 Grace Blackwell Ultra 芯片,既能撑起 350 万美元级的数据中心机柜,也能塞进一台放在办公桌上的 DGX Station。2026 年 10 月微软活动上预览的 DGX Station for Windows,让这个"双面故事"变得更加完整。本文依据站内芯片数据库,梳理 GB300 在 Blackwell 家族中的定位、桌面与数据中心的产品分层,以及 WSL 桥接对 Windows 企业市场的意义。

GB300 在 Blackwell 家族中的定位​

GB300 是 NVIDIA 第三代 Grace Blackwell 超级芯片,2025 H2 发布。其代际演进脉络清晰:

指标GH200 (2023-Q3)GB200 (2024-Q4)GB300 (2025 H2)
GPUH100B200B300 Ultra
CPUGrace 72 核Grace 72 核Grace 72 核
GPU 内存96GB HBM3192GB HBM3e288GB HBM3e
GPU 带宽3.35 TB/s8 TB/s10 TB/s
NVLink 域内60 TB/s130 TB/s130 TB/s
网络ConnectX-7 400GConnectX-8 800GConnectX-9 1.6T
FP4 sparse(单 GPU)N/A(FP8 2 PF)10 PF15 PF
TDP(GPU)1000W1000W1400W

GB300 超级芯片 = 2 颗 B300 Ultra GPU + 1 颗 Arm Grace CPU(72 核 Neoverse V2),通过 900 GB/s 的 NV-HBI 高速接口配对。据站内芯片数据库,单 Superchip FP4 sparse 算力 30 PFLOPS、FP8 dense 7.5 PFLOPS、GPU 侧总显存 576GB HBM3e,Superchip 模块单价约 7-8 万美元。

B300 Ultra:288GB HBM3e 的推理特化​

B300 Ultra(Blackwell Ultra)是 Blackwell 的中期升级版本,2026 年 1 月正式出货。据站内芯片数据库:

  • 显存:288GB HBM3e(12-Hi 堆叠),相比 B200 的 192GB 提升 50%,可单卡加载 FP16 的 70B 模型并保留 100GB+ 给 KV Cache;
  • 算力:FP4 稀疏 30 PFLOPS、FP8 密集 7 PFLOPS,相比 B200 均提升约 56%;
  • 实测:DeepSeek-R1 Prefill 吞吐 22,476 TGS,相比 H200 提升 8 倍;短输出场景提升 20 倍。

需要说明的是,站内 b300-ultra 卡按单卡口径记录 FP4 稀疏 30 PFLOPS,而 gb300 卡的代际对比表按单 GPU 口径记 15 PFLOPS(Superchip 两颗合计 30 PFLOPS),两个数据源口径存在差异,读者引用时需注意区分。B300 的制程仍为台积电 4NP,升级重心放在显存容量与 FP4 精度上——这正是"中期升级"的典型特征:架构不动,围绕推理经济性做增量。

NVL72 机柜:数据中心旗舰形态​

36 颗 GB300 组成 NVL72 机柜(72 颗 B300 Ultra + 36 颗 Grace),据站内芯片数据库:

项目配置
HBM 总量20.7 TB HBM3e
LPDDR5X 总量34.6 TB
NVLink 5 域内130 TB/s 全互联
ConnectX-9 出口72× 1.6T = 115 Tb/s
FP4 sparse 总算力1.08 EFLOPS
机柜 TDP约 120kW(含冷却)
价格约 330 万美元/机柜

ConnectX-9 是这代机柜的隐性升级:单端口 1.6 Tb/s 相比 ConnectX-8 翻倍,延迟低于 0.5 微秒,支持 NVLink over IB 跨机柜互联。8 个机柜可组成 NVL576 域——576 颗 B300 Ultra 共享 130 TB/s 互联,是业界最大单一 NVLink 域,对万亿参数 LLM 训练至关重要。云端租用方面,行业口径(Nebius)B300 的租用价格约为 9.50 美元/GPU 小时,站内芯片数据库另记录 AWS 8 卡 B300 实例(p6-b200.48xlarge)单 GPU 小时价 11.70 美元,不同供应商价差明显。

在 token 成本维度,站内数据给出了关键洞察:B300 单价虽高,但以 Llama 70B 推理测算,FP4 量化下单 token 成本相比 H100 低约 61%——单价高不等于用得贵。

DGX Station:20 PFLOPS 的桌面超算​

2026 年 10 月的微软活动上,NVIDIA 预览了 DGX Station for Windows,核心配置:

  • 芯片:GB300 Grace Blackwell Ultra Desktop Superchip;
  • 一致性内存:748GB(252GB HBM3e + 496GB LPDDR5X);
  • 算力:最高 20 PFLOPS FP4;
  • 模型能力:可在本地运行约 1 万亿参数模型;
  • 软件:Linux 工具链经 WSL(Windows Subsystem for Linux)访问;
  • 上市:2026 Q4,ASUS、Dell、HP、Lenovo 推出整机。

产品分层:1 PFLOPS 与 20 PFLOPS 之间​

DGX Station 的出现补全了 NVIDIA 桌面产品线的断层。站内芯片数据库记录的 RTX Spark(RTX DGX Spark)定位约 1 PFLOPS 级 FP4 算力的紧凑桌面开发机,而基于 GB300 Desktop Superchip 的 DGX Station 直接把桌面算力抬到 20 PFLOPS——20 倍的分层差距,对应着完全不同的用户画像:

维度RTX SparkDGX Station (GB300)
算力约 1 PFLOPS FP4最高 20 PFLOPS FP4
内存统一紧凑内存748GB 一致性内存
目标场景个人开发、微调小型模型本地万亿参数推理、企业级开发
价格量级消费级/准专业级高端工作站

WSL 桥接:Windows 企业市场的钥匙​

DGX Station for Windows 最值得玩味的细节是"Linux 工具链经 WSL 访问"。CUDA 生态的主场在 Linux,此前企业若要在 Windows 环境做本地 AI 开发,往往需要双机或虚拟化方案。WSL 桥接意味着:

  1. 企业 IT 无需改变管理习惯:Windows 域、组策略、合规审计体系原样保留;
  2. 开发者无需迁移工作流:PyTorch、TensorRT-LLM 等工具链在 WSL 内原生运行;
  3. 数据不出本地:金融、医疗、政务等对数据合规敏感的行业,获得了一条"本地跑万亿参数模型"的合规路径。

这与 GB300 数据中心侧的统一内存设计一脉相承:Grace 上 480GB LPDDR5X 与 B300 上 288GB HBM3e 统一寻址,CPU 与 GPU 共享一致性内存池。桌面版把同样的架构哲学浓缩进一台工作站——数据搬运越少,推理经济性越好。

小结​

GB300 家族展示了 NVIDIA 的典型打法:一颗芯片,从数据中心机柜到桌面工作站全栈铺开。数据中心侧,B300 Ultra 用 288GB HBM3e 和 FP4 精度把推理 token 成本压到 H100 的四成以下;桌面侧,DGX Station 用 20 PFLOPS FP4 和 748GB 一致性内存把"本地大模型"从口号变成 Q4 可买的产品。而 Rubin R200 已在 H2 2026 接棒数据中心旗舰,GB300 的价值窗口正在收窄——但它建立的"统一内存 + 桌面到机柜分层"产品范式,将由 Vera Rubin 平台延续下去。

服务器 CPU 变天:EPYC Venice 256核 2nm 量产 vs Intel 三度涨价仍失份额

· 5 min read
Industry Research Team

服务器 CPU 市场正在经历一次角色重定义:AMD 用 2nm 制程和 256 核密度继续扩大领先,Intel 被迫靠涨价在需求中求生,而 NVIDIA 自研 Vera CPU 则带着 AI 专用设计入场。AI 服务器里 CPU 不再是主角,但恰恰因此,它的选型逻辑被彻底改写。

AMD Venice:2nm 量产 + 256 核密度登顶​

AMD 第六代 EPYC "Venice"(Zen 6 架构,最高 256 核)已经在台积电 2nm 产线启动量产,这是行业首批进入 2nm 量产的处理器产品之一。更值得关注的是,量产正在从台积电延伸至 AMD 的亚利桑那工厂——先进制程的美国本土化,对政府采购和主权 AI 项目是重要的加分项。

项目EPYC Venice(6th Gen)说明
架构Zen 6新一代核心
最高核心数256 核服务器 CPU 密度新纪录
制程TSMC 2nm,延伸至亚利桑那工厂首批 2nm 量产处理器
角色定位Helios 机架 CPU,配套 72×MI455XAI 机架主机侧
下一代"Verano",已为 AI 工作负载预留设计设计即前馈

Venice 还有两层战略价值:其一,它是 Helios 机架(72 颗 MI455X)的配套 CPU,AMD 的 GPU 机架方案因此获得了"自家 CPU+自家 GPU"的垂直整合能力;其二,下一代 "Verano" 已经为 AI 工作负载预留设计,说明 AMD 在产品定义阶段就开始为 AI 节点做优化,而不是拿通用服务器芯片顺手兼容。

Intel:年内三度涨价,份额仍在流失​

Intel 的处境则截然不同。10 月 5 日起,Intel 对 CPU 提价 10%——这是年内第三次涨价,驱动因素是 AI 需求带动的产能紧张。但涨价并没有止住份额流失:多家分析师在报告中持续给出卖出的建议口径,认为 Intel 服务器 CPU 的市场份额下滑尚未见底。

维度AMDIntel
制程2nm 量产(Venice)制程追赶中
核心数路线256 核密度登顶密度竞赛落后
价格策略产品迭代驱动年内三度涨价(累计幅度未公开)
服务器份额持续提升持续流失(分析师建议卖出口径)
价格支撑机架级方案带动AI 服务器配套 x86 需求托底

值得注意的悖论是:Intel 涨价的底气部分恰恰来自 AI——AI 服务器爆发也拉动了配套 x86 CPU 的需求,产能紧张让 Intel 敢于连续提价。但"涨价求生"的另一面是,客户在 AI 服务器 CPU 选型上的议价空间被压缩,这反而给了 AMD 和 NVIDIA 更多切入机会。

Vera 入场:AI 节点上的 CPU 重新定义​

NVIDIA 自研的 Vera CPU 是第三个变量。Daytona 基准测试给出了一个惊人的对比:Vera 跑千沙盒仅需 10.8 秒,而 AMD 旗舰 EPYC 9755 需要 88.4 秒——约 8 倍的差距。

对比项NVIDIA VeraAMD EPYC 9755
Daytona 千沙盒10.8 秒88.4 秒(约 8 倍耗时)
设计目标专为 AI 节点设计通用服务器负载
配套内存Vera SCF + 1.5TB LPDDR5X传统 DIMM 路线

Vera 的设计思路与通用服务器 CPU 完全不同:SCF 互联加 1.5TB LPDDR5X 的组合,是专为 AI 节点上"数据搬运 + 调度"的角色优化的。在 Grace/Vera 与 GPU 紧耦合的架构里,CPU 的传统性能指标(如 SPEC 系列)重要性下降,而内存带宽、与加速器的耦合效率成为新的评价维度。

分析:AI 服务器中 CPU 角色的重定义​

AI 服务器里,CPU 不再是算力的主角,而是被压缩到三个角色:主机侧调度(内核、虚拟化、作业分发)、数据搬运(存储/网络与 GPU 之间的通路)、以及配套生态(x86 软件兼容性)。这带来了三强格局下的不同打法:

  • AMD 走密度路线:用 256 核 + 2nm 的硬件优势,同时服务传统虚拟化和 AI 机架主机侧,Venice 与 Helios 的绑定让"买 AMD GPU 就配 AMD CPU"成为默认选项;
  • Intel 涨价求生:利用产能紧张和 x86 生态惯性提价保收入,份额换取现金流,等待下一代产品翻盘;
  • NVIDIA 自研入场:Vera 不参与通用服务器竞争,只在 AI 节点上用专用设计建立垂直优势,Daytona 8 倍的差距就是其叙事武器。

对采购方的影响:三强博弈叠加产能紧张,意味着锁量窗口正在关闭。Intel 年内三度涨价已经发出信号——服务器 CPU 的价格曲线在 2026 年是向上的。有大批量采购计划的企业,应尽快与供应商锁定价格和交期;同时,AI 集群主机侧 CPU 的选型需要重新评估,传统"EPYC 对标 Xeon"的通用跑分逻辑,在 Vera 这类 AI 专用 CPU 出现后已不再充分。

小结​

服务器 CPU 市场的竞争维度正在迁移:从通用性能转向"AI 节点适配度"。AMD Venice 以 2nm + 256 核的量产优势延续密度路线,并借 Helios 机架实现 CPU/GPU 协同;Intel 连续三次涨价反映的是产能紧张下的议价权,而非竞争力回升;NVIDIA Vera 用 Daytona 基准 8 倍的成绩宣告 AI 专用 CPU 的独立赛道成立。对采购方而言,2026 年的关键词是"锁量"和"重估"——锁定涨价前的采购窗口,重估 AI 集群中主机侧芯片的技术选型标准。

Vera CPU 深度:SCF + 1.5TB LPDDR5X,NVIDIA 自研 CPU 的野心

· 7 min read
Industry Research Team

当所有人盯着 Rubin R200 的 50 PFLOPS FP4 时,真正决定这台机器推理经济性的,可能是一颗 CPU。Vera——NVIDIA 首次全面自研核心的数据中心 CPU,用 88 个 Olympus 核心、第二代 SCF 一致性结构和 1.5TB LPDDR5X,重新定义了"AI 工厂的主机处理器"。本文依据站内芯片数据库与智能体基准实测,拆解 NVIDIA 从外购 Arm 核到自研 SCF 的演进逻辑。

从 Grace 到 Vera:自研之路的三级跳​

NVIDIA 的 CPU 战略经历了三个阶段:GH200/GB200 时代的 Grace CPU 基于 72 核 Neoverse V2 公版 Arm 核心,本质是"外购核心 + 自研互联";GB300 延续了这一代 Grace;而 2026 年 GTC 发布的 Vera 则完成质变——核心、片上互连、内存子系统全部自研。据站内芯片数据库,Vera 的核心规格如下:

规格参数
CPU 架构ARM 架构(自研 Olympus 核心)
指令集ARMv9.2(完全兼容)
核心数量88 个 Olympus 核心
线程数量176 个线程(空间多线程)
单核性能前代产品的 2 倍
最大内存容量1.5 TB(LPDDR5X)
内存带宽1.2 TB/s
互联技术NVLink-C2C(1.8 TB/s)
片上互连第二代 SCF(3.4 TB/s 对分带宽)
发布时间2026 年 3 月 17 日
量产时间2026 年下半年

SCF:88 核无延迟扩展的底座​

SCF(Scalable Coherency Fabric,可扩展一致性结构)是 Vera 最值得细看的技术。第二代 SCF 提供 3.4 TB/s 对分带宽,采用片上网格 + 统一缓存设计,可无延迟扩展 88 个核心。

对分带宽(bisection bandwidth)是衡量片上互连质量的关键指标:它表示把芯片切成两半时,两半之间的总通信带宽。88 核的大芯片如果对分带宽不足,核心越多内耗越大。第二代 SCF 用网格拓扑让任意核心间的通信路径趋于均匀,配合统一缓存避免一致性流量的长距离穿梭——这正是 Vera 敢于采用单体计算芯片设计(而非多小芯片拼接)的底气:避免跨小芯片通信延迟,在所有核心满载时保持稳定延迟和吞吐量,性能可预测性强。

1.5TB LPDDR5X:把内存子系统当主武器​

Vera 将 SCF 与高达 1.5TB 的 LPDDR5X 内存子系统结合。对比上一代 Grace 的规格变化一目了然:

指标Grace(GB200/GB300)Vera提升
内存容量480GB LPDDR5X最高 1.5TB LPDDR5X约 3 倍
内存带宽512 GB/s1.2 TB/s约 2.3 倍
CPU-GPU 互联NV-HBI 900 GB/sNVLink-C2C 1.8 TB/s2 倍
核心数72 核 Neoverse V288 核 Olympus+22%

更关键的是系统级设计:LPDDR5X 与 GPU 的 HBM4 可视为单一一致性内存池。这意味着数据不再需要在"CPU 内存"和"显存"之间显式搬运,两个物理上分离的内存子系统在软件视角下是一体的。对推理业务,这带来两个直接收益:KV 缓存卸载——不常用的注意力上下文可以下沉到 LPDDR5X 侧,把昂贵的 HBM4 带宽留给热点数据;多模型高效执行——多个模型实例共享同一内存池,切换与加载开销大幅降低。

Daytona 实测:智能体时代的 CPU 门槛​

2026 年 10 月 10 日公布的 Daytona 智能体基准测试,给 Vera 的实际能力提供了量化注脚。智能体负载的特点是海量并发沙盒的创建与销毁——恰恰考验 CPU 的内存容量、一致性与调度效率:

测试项VeraAMD EPYC 9755差距
1000 沙盒上线10.8 秒88.4 秒约 8 倍
峰值智能体任务吞吐13.3 任务/秒——
2000 沙盒上线27.4 秒——

8 倍的沙盒上线速度差距说明:智能体负载对 CPU 的要求已与通用计算分道扬镳——容量大(1.5TB 装下海量沙盒状态)、带宽高(1.2TB/s 喂饱并发)、一致性结构强(88 核高效协作)。站内芯片数据库同时记录,Vera 的软件环境运行速度相比传统架构 CPU 提升最高 50%,满负载下强化学习评估周期可缩短 50%。

与 Groq 3 LPX 的异构分工​

Vera 所在的 Rubin 平台还有一位非常规队友:NVIDIA 收购 Groq 后推出的 Groq 3 LPX。据站内芯片数据库,LPX 机架集成 256 颗 LPU,聚合 128GB 片上 SRAM,聚合带宽高达 40 PB/s,官方口径的能效优势显著(35× perf/W vs H100 推理)。在 Rubin 平台的分工中,GPU 承担训练与 prefill,Groq 3 LPX 专攻智能体解码阶段的低延迟输出——而 Vera 则是这一切的调度中枢。prefill 吃算力、decode 吃带宽、调度吃一致性与容量,三种负载由三种架构分别消化,这正是"每 token 经济学"推导出的异构架构必然性。

Vera vs EPYC Venice:服务器 CPU 的新战场​

Vera 的出现让 NVIDIA 与 AMD 在服务器 CPU 领域正面相遇。据站内芯片数据库,AMD EPYC Venice(2026 CES 发布)是全球首款 2nm 数据中心 CPU:

指标NVIDIA VeraAMD EPYC Venice(Zen 6C)
核心88 个自研 Olympus最多 256 个 Zen 6C
制程未公开台积电 2nm(N2)
内存1.5TB LPDDR5X16 通道 DDR5
单路带宽1.2 TB/s1.6 TB/s
L3 缓存—1GB
卖点NVLink-C2C、CPU-GPU 一致性通用性、x86 生态

两者的定位差异明显:EPYC Venice 是通用数据中心 CPU 的极致(256 核、x86 生态、Helios 机架中与 MI455X 组队),而 Vera 是 AI 专用 CPU——它不做通用服务器生意,只为 AI 工厂的主机负载优化。Vera 甚至支持硬件级 FP8 计算,是全球首款支持 FP8 精度的 CPU,并支持全机密计算的硬件级安全隔离。竞争的天平取决于一个问题:AI 工厂的 CPU 采购,会不会整体从通用服务器预算中剥离?如果会,Vera 绑定 Rubin GPU 的销售模式将是护城河;如果不会,EPYC 的生态广度仍难撼动。

小结​

Vera CPU 标志着 NVIDIA 完成了从"用别人的核心攒超级芯片"到"自研全套主机平台"的跃迁:SCF 的 3.4TB/s 对分带宽解决了 88 核扩展难题,1.5TB LPDDR5X 与 HBM4 构成的一致性内存池重构了推理数据流,Daytona 实测的 8 倍沙盒优势则证明智能体负载确实需要一颗不一样的 CPU。它的野心不在挑战 x86 的通用服务器王座,而是重新划定一条边界——AI 基础设施中,CPU 是 GPU 子系统的一部分,而不是独立采购的商品。这条边界能否成立,将决定未来五年服务器市场的版图。

RTX Spark 笔记本开订、DGX Station 登陆 Windows:NVIDIA 把 AI 超算搬上办公桌

· 5 min read
Industry Research Team

在旧金山举行的微软 Windows AI 与 Surface 活动上,NVIDIA 一手开启 RTX Spark 笔记本预订,一手预览 DGX Station for Windows——从 1 PFLOP FP4 的笔记本到 20 PFLOPS FP4 的桌面工作站,AI 算力正在从数据中心一路铺到办公桌。

RTX Spark 笔记本正式开订​

在微软于旧金山举行的 Windows AI 与 Surface 活动上,NVIDIA 宣布 RTX Spark 笔记本正式开启预订,首批产品将于 10 月 16 日(周五)发货;紧凑型桌面产品则计划在 11 月跟进上市。

OEM 阵容覆盖了几乎所有主流 PC 品牌:Acer、ASUS、Dell、HP、Lenovo、Microsoft(Surface Laptop Ultra)、MSI、Gigabyte 全部在列。从发布即有如此完整的品牌背书来看,RTX Spark 显然不是一款演示性产品,而是要成长为一个完整的终端新品类。

Blackwell RTX + Grace CPU:数据中心架构下沉终端​

RTX Spark 的硬件方案可以概括为"把 Grace Blackwell 的思路压缩进 PC":

  • GPU:基于 Blackwell 架构的 RTX GPU,最高 6144 个 CUDA 核心;
  • CPU:最多 20 核的 Grace CPU;
  • 互联:CPU 与 GPU 之间提供 600 GB/s 高速链路;
  • 算力:最高 1 PFLOP FP4;
  • 内存:最高 128GB 统一内存,CPU 与 GPU 共享同一内存池;
  • 软件:运行完整 CUDA 栈。

其中"统一内存 + 完整 CUDA 栈"是两个关键点:前者决定了本地能装下多大的模型,后者决定了云端训练的代码可以低成本迁移到本地调试,开发者不必为桌面场景另学一套工具链。

DGX Station for Windows 首次预览​

如果说 RTX Spark 面向个人开发者,那么同场预览的 DGX Station for Windows 则瞄准了更高一层的需求。它基于 GB300 Grace Blackwell Ultra Desktop Superchip,拥有 748GB 一致性内存,算力最高可达 20 PFLOPS FP4,目标是让用户在本地运行约 1 万亿参数的模型。

对 Linux 生态的兼容也给出了务实答案:Linux 工具链可以通过 WSL(Windows Subsystem for Linux)访问。DGX Station for Windows 将于 Q4 上市,由 ASUS、Dell、HP、Lenovo 四家推出。

Surface Laptop Ultra 与内存挤压隐忧​

作为活动的另一主角,Surface Laptop Ultra 已于 10 月 7 日开启预订,最高配备 128GB 统一内存——这个容量已经接近入门级推理服务器的水平。

但 DIGITIMES 提出了一个不容忽视的问题:AI PC 的内存供给正在被服务器需求挤压。在内存厂商的优先级排序中,服务器 DRAM 需求被放在首位,AI PC 依赖的 LPDDR5X 供给承压。在存储供应紧张的背景下,128GB 统一内存的 AI PC 能否稳定供货,本身就是一个变数。

从云端到桌面的算力分层​

把 NVIDIA 目前的桌面产品线摆在一起,可以清晰看到一条算力分层路线:

产品形态关键规格定位
DGX Spark桌面 AI 超算64GB 统一内存、1 PFLOP FP44,999 美元,个人与小团队原型验证
RTX Spark 笔记本笔记本最高 6144 CUDA 核心 + 最多 20 核 Grace CPU、最高 128GB 统一内存随身开发与调试
DGX Station for Windows桌面工作站GB300 Grace Blackwell Ultra Desktop Superchip、748GB 一致性内存、最高 20 PFLOPS FP4本地运行约 1 万亿参数模型

这条路线的逻辑是:云端负责大规模训练与生产推理,桌面负责原型验证、微调与敏感数据场景,笔记本负责日常开发与演示。当模型越做越大、数据合规要求越来越严,"把算力放在身边"的价值正在上升。

Windows CUDA 原生化与 WSL 的务实路线​

过去十几年,CUDA 的主战场在 Linux 服务器上,Windows 开发者在工具链上长期处于跟随位置。RTX Spark 与 DGX Station for Windows 意味着完整 CUDA 栈第一次以原生姿态大规模进入 Windows 桌面场景。

而 WSL 桥接 Linux 工具链的安排,则是一种典型的务实路线:既照顾 Windows 用户的使用习惯,又不要求现有 Linux 工作流推倒重来。对于在 Windows 环境中做模型开发和内部工具的企业开发者来说,迁移成本被明显降低;对 NVIDIA 而言,这等于把整个 CUDA 开发者生态延伸到了全球存量最大的桌面操作系统上。

小结​

RTX Spark 笔记本开订与 DGX Station for Windows 预览,标志着 NVIDIA 把 AI 算力的故事延伸到了最后一米:从数据中心,到桌面工作站,再到背包里的笔记本。1 PFLOP FP4 到 20 PFLOPS FP4 的分层算力、128GB 到 748GB 的统一内存、WSL 桥接的 Linux 工具链,共同构成了一条完整的桌面 AI 开发路径。剩下的悬念有两个:一是 LPDDR5X 供给紧张会不会卡住 AI PC 的出货节奏,二是 11 月的紧凑型桌面和 Q4 上市的 DGX Station 能否如期落地。

AI芯片周报(2026年第41周):2nm量产竞速、存储新范式与机架级大战

· 4 min read
Industry Research Team

2026年第41周(9月28日—10月6日前后),AI芯片行业密集事件爆发:NVIDIA N1X冲击PC市场、Intel年内第三次涨价、AMD Helios量产、MLPerf新纪录、存储新范式、国产涨价与上市潮。本篇按国际、国产、存储与系统、资本与市场四节汇总。

国际动态​

NVIDIA N1X发布(10-04):NVIDIA发布N1X PC处理器,直接竞争Intel与AMD的PC处理器市场,当日两家股价各下跌4.2%。N1X基于RTX Spark芯片、与微软合作打造,2026年秋季上市。

Intel CPU涨价10%(10-05生效):这是Intel自2025年以来的第三次涨价,受AI需求和产能紧张驱动。

AMD Helios量产(9-18报道):MI455X首批出货目标Q3末,OpenAI 6GW、Meta 6GW、Anthropic合作兑现中,微软为首批客户之一。

MLPerf Inference v6.1(9-16):Vera Rubin NVL72首秀,跑Qwen3-VL较GB300最高提升3.7倍;AMD MI350以512卡创下575万tokens/秒的纪录。

事件时间要点
N1X发布10-04Intel/AMD股价各跌4.2%,2026秋季上市
Intel涨价10%10-05生效年内第三次涨价
Helios量产9-18报道MI455X首批Q3末出货
MLPerf v6.19-16Rubin NVL72较GB300最高3.7倍

国产动态​

华为昇腾950:智算集群云服务9月30日国内商用,11月30日全球商用;昇腾960超节点引入NPO技术、支持4096卡、提供8E FP8算力。

平头哥真武V900(9-22云栖大会):216GB显存、1200GB/s带宽,2027年Q1量产;同期发布倚天720/730 CPU路线图。

国产芯片涨价(路透):寒武纪690与昇腾950DT涨价20%-50%,HBM成本上涨是主要驱动。

燧原科创板上市(9-11):开盘上涨188.37%,市值达1764亿元。

摩尔线程"庐山":年底亮相,3A渲染性能提升15倍、光追50倍、AI 64倍。

存储与系统​

SK海力士:9月17日发布HBF/PIM/eSSD/SALT-KV组合,9月18日成立SK hynix Ventures投资生态;美光9月15日发布超密度服务器内存模组;AWS Annapurna×NVIDIA推进NVHBM定制内存;长鑫存储据路透报道筹备进军NAND。

电网与能效:Emerald AI、Google、NVIDIA于9月16日成立AEMA(先进能源与算力联盟);NVIDIA DSX MaxLPS助力Lambda实现同功率下token吞吐+24%、每瓦性能+23%。

存储玩家动作
SK海力士HBF/PIM/eSSD/SALT-KV + 设立Ventures
美光超密度服务器内存模组
AWS×NVIDIANVHBM定制内存
长鑫存储筹备进军NAND

资本与市场​

份额格局:据Counterpoint口径,国产AI芯片从2022年的近乎零份额,到2025年已达41%;其中华为昇腾约占国产市场的62%。

股价与估值:同期美股芯片板块上涨,NVIDIA收涨2.54%、AMD涨超6%。

下周关注​

  1. 昇腾950云服务全球商用倒计时:11月30日全球商用节点临近,海外部署进展值得跟踪;
  2. Helios首批交付:MI455X能否兑现Q3末首批出货目标;
  3. Q4国产新卡发布窗口:年底前后国产厂商新品密集期,摩尔线程"庐山"亮相在即。

小结​

第41周的主线是"三重加速":算力侧(N1X、Helios、MLPerf新纪录)节奏空前,存储侧(HBF、NVHBM、SALT-KV)范式更新,供给侧(Intel涨价、国产涨价20%-50%)紧张加剧。国产份额41%的数据说明格局重塑已在发生,Q4将是验证兑现能力的关键窗口。

5GW、10GW成为新单位:Anthropic与OpenAI的算力军备竞赛

· 5 min read
Industry Research Team

当算力的计量单位从"多少张卡"变成"多少吉瓦",AI竞争的本质已经改变:大模型公司正在变成"能源公司+基建公司+模型公司"的三位一体。

5GW与10GW:新计量单位的诞生​

2026年9月的行业报道显示,AI算力竞赛进入了一个全新的量级:Anthropic的目标是在今年年底拥有约5GW的可用算力,而OpenAI明年的规划则是约10GW。

这两个数字意味着什么?5GW大致相当于数百万张高性能GPU同时满负荷运转所需的电力,而10GW已经接近一座大型核电站的装机容量。就在一年前,行业讨论的还是"十万卡集群";如今,头部玩家谈论的是吉瓦级园区。算力竞赛的计量单位,已经从GPU的数量彻底转向了电力的功率。

从"买卡"到"买电厂"​

这种变迁背后,是AI产业价值链的整体上移:

  • 能源成为第一约束。先进AI芯片供应在改善,但变电站、输电线路和发电容量的建设周期以年计。谁拿到电力指标,谁就拿到训练下一代模型的入场券。
  • 基建能力成为核心竞争力。数据中心不再是租用IDC机房那么简单,而是涉及选址、并网、冷却系统乃至自有发电能力的系统工程。
  • 模型公司与芯片公司深度绑定。OpenAI与博通合作开发Jalapeño自研芯片,并规划多吉瓦级部署,这已经不是"采购算力",而是"定制算力供应链"。

20-30MW小数据中心为何成为抢手货​

一个耐人寻味的细节是:Anthropic和OpenAI两家还在争抢20-30MW级别的小型数据中心,Anthropic甚至向SpaceX租用算力。

原因很直接——大容量数据中心从规划到投运周期太长,而模型训练和推理需求等不起。20-30MW的小站点虽然容量有限,但胜在可快速拿容量:现有楼宇改造、电力接口现成、数月内即可上线。对于急需算力缺口的大模型公司,这批"小快灵"资源成了战略物资,甚至在二级市场上被反复转租、溢价争夺。向SpaceX租算力则更为激进——当地面电力不够快时,头部玩家已经开始评估包括星载算力在内的非常规选项。

算力军备竞赛的经济账​

这场竞赛的规模有多大?根据Bain 2026技术报告的口径,AI硬件市场2025年约为312.1亿美元,2026年预计达到384.9亿美元。而吉瓦级算力园区背后,是单笔动辄数十亿美元级别的芯片采购与多年期电力合约。

算力的本质正在从"IT设备"变成"重资产基础设施"——它的融资方式(项目融资、长期租约)、回报模型(算力利用率、每token成本)都越来越像电厂和通信网络,而不是服务器机房。

对AI芯片厂商意味着什么​

吉瓦级竞赛重塑了芯片厂商的客户结构,谁绑定大客户谁受益的格局愈发清晰:

厂商核心绑定关系算力绑定规模
NVIDIA微软 / OpenAI深度绑定OpenAI,吉瓦级部署主力供应商
AMDOpenAI / Meta / AnthropicOpenAI 6GW、Meta 6GW、Anthropic(多年期协议)
OpenAI(自研)博通合作Jalapeño多吉瓦级部署规划
云厂商自研AWS Trainium、Google TPU等服务自有平台负载

对芯片厂商而言,这带来两个深远影响:其一,订单变得极度集中,一张吉瓦级订单足以改变一家芯片公司的营收曲线,NVIDIA与AMD过去一年股价的分化某种程度上就是绑定关系的映射;其二,芯片设计开始围绕客户的电力预算优化,每瓦性能取代峰值算力成为核心指标——因为客户的稀缺资源不是芯片,而是那几吉瓦的电。

小结​

5GW和10GW不只是两个数字,它们标志着AI竞争进入了"基建时代":电力取代芯片成为第一约束,20-30MW小数据中心成为快速补位的战略资源,大模型公司集能源、基建、模型三重身份于一身。对AI芯片产业来说,这意味着订单向深度绑定大客户的产品集中、设计向每瓦性能倾斜。算力军备竞赛的下半场,比的不是谁的芯片跑分更高,而是谁能先把电厂建起来、把电接进来。

Groq 3 LPX Enters Full Mass Production: Samsung 4nm Foundry, 315 PFLOPS FP8 per Rack — NVIDIA Turns the LPU into the Seventh Chip of Vera Rubin

· 5 min read
Industry Research Team

This article is based on NVIDIA official product pages, the March 2026 GTC architecture blog, and third-party benchmark data; performance figures are vendor architecture comparisons, and actual gains should be verified with your own tests.

NVIDIA has confirmed that Groq 3 LPX — the "seventh chip" of the Vera Rubin platform — has entered full mass production, manufactured at Samsung's Pyeongtaek campus. This is the first time the deal has landed in the form of production silicon since December 2025, when NVIDIA spent roughly $20 billion to obtain a non-exclusive IP license to Groq plus its core engineering team.

For the inference hardware landscape, this is a paradigm-level event: for the first time, NVIDIA has incorporated a "specialized inference architecture defined by someone else" into its own flagship platform — and not as an add-on sale, but as deep co-design.

1. The Groq 3 LPU Chip and the LPX Rack: Specs at a Glance​

Single Groq 3 LPU (4nm, Samsung foundry):

ItemValue
Compiler-managed on-chip SRAM500 MB
SRAM bandwidth150 TB/s
Chip-to-chip scale-up bandwidth2.5 TB/s (96 chip-to-chip links, 112 Gbps each)

A single LPX rack (32 1U liquid-cooled trays, 8 LPUs per tray):

ItemValue
Total LPUs256
FP8 compute315 PFLOPS
Total on-chip SRAM128 GB
Aggregate SRAM bandwidth40 PB/s
In-rack scale-up bandwidth640 TB/s
DDR5 memory12 TB (hosting large model weights)

The 500 MB of SRAM per LPU may not look like much, but multiplied by 256 LPUs and stacked with 40 PB/s of aggregate bandwidth, it forms the physical foundation of "deterministic low-latency decoding" — the LPU's design philosophy is precisely to use compiler static scheduling of on-chip SRAM to completely eliminate memory-fetch stalls during the inference decoding phase, which is exactly the most typical bottleneck of GPU inference.

2. AFD: Attention and FFN Split Up, GPU and LPU Each Do Their Own Job​

LPX does not replace the GPU; instead, it forms a heterogeneous system with Vera Rubin NVL72, centered on AFD (Attention-FFN Disaggregation):

  1. Rubin GPUs handle prefill and attention — building the KV cache over large contexts and executing attention layers, consuming HBM capacity and high throughput;
  2. Groq 3 LPUs handle FFN / MoE expert-layer decoding — latency-sensitive and pattern-predictable, exactly the home turf of deterministic SRAM scheduling;
  3. Intermediate activations are exchanged between the two engines token by token, orchestrated and routed by NVIDIA Dynamo: the GPU computes every attention layer, the LPU computes every feed-forward layer, jointly producing each output token.

The logic of this division of labor is clear: agentic AI applications can consume 15x the tokens of traditional AI applications, and the bottleneck shifts from "can it finish computing" to "can it keep emitting tokens at stable low latency." Let the big HBM container run attention, and let the deterministic SRAM engine run decode — each plays to its strengths.

3. Measured Results and Official Figures​

  • Third-party benchmarks (Artificial Analysis): with Gemma 4 31B at a 100K token context, LPX output reaches roughly 3400 tokens/s — inter-token intervals below 1 millisecond, a qualitative leap in interactivity for long-context agentic scenarios
  • Official architecture comparisons: with LPX added, Vera Rubin NVL72 achieves up to 35x higher throughput per megawatt on trillion-parameter models; up to 10x more revenue opportunity per watt in "high-value token" scenarios
  • Launch customers: Nebius is the first to deploy LPX racks to expand its token capacity; CoreWeave already connects Vera Rubin racks in production with Spectrum-X Multiplane

It must be emphasized: the 35x/10x figures are architecture comparisons at specific high-interaction operating points, not universal conclusions. For training, high-throughput batch inference, and workloads that need CUDA ecosystem flexibility, the GPU remains the right answer; LPX's home turf is scenarios where "single-user interactive latency is the product" — agent loops, real-time coding assistants, long-context conversations.

4. Three Industry Signals​

1. Specialized inference chips get absorbed, not opposed. The old narrative of the LPU as a "GPU challenger" has become part of Vera Rubin. The endgame for inference hardware may not be one architecture winning, but the heterogeneous combination of "GPU + specialized decoding engines" becoming the standard. For other inference chip startups (Cerebras, Etched, etc.), this is both proof that the ceiling has risen and a warning: get integrated or find differentiation.

2. Samsung foundry lands a high-end AI order. Against the backdrop of TSMC's near-monopoly on AI main chips, Samsung 4nm taking on LPX mass production is highly significant — combined with Tesla's earlier AI6 2nm order, Samsung foundry has a shot at returning to full-year profitability in 2027.

3. Inference economics enters the "priced per MW" era. When vendors start telling their story with tokens/MW and revenue per watt, the core KPI of compute selection has completely shifted from peak compute (TFLOPS) to token output per unit of energy. This is consistent with the power-and-electricity cost model built into our TCO Calculator: the chip with the best-looking peak specs is not necessarily the chip with the lowest cost per token.

Summary​

Groq 3 LPX mass production marks the arrival of a heterogeneous era for inference hardware: "GPUs manage throughput, LPUs manage latency." For teams currently selecting inference clusters, the recommendation is to evaluate workloads separately: keep batch offline inference on GPUs, and separately calculate the unit cost of LPX-class solutions for interactive long-context agents. If in doubt, run the 3-year total cost of ownership of both architectures through the TCO Calculator before deciding.

(Performance data in this article comes from NVIDIA official architecture comparisons and Artificial Analysis third-party benchmarks; for actual deployments, please rely on your own testing.)

GPU Rental Rates Climb Again: Nebius Raises H100/B200 On-Demand Prices About 20% From October, and the Build-vs-Rent Balance Is Shifting

· 5 min read
Industry Research Team

According to ZhiXun (media) reporting in late September, Nebius announced that on-demand rates for H100 / H200 / B200 will rise by an average of about 20% starting October 1. The same month, Cailian Press reported that as of August 11 CoreWeave's contracted power had grown to 4.2 GW and that it would "keep signing new compute at higher prices". This is the Nth consecutive price increase in the rental market this AI cycle — and for buyers, the TCO balance between building and renting is shifting. This article works through the math using the site's TCO calculator methodology.


1. Three Forces Behind the Price Hikes​

  • Exploding agentic inference demand: from MLPerf v6.1 to SemiAnalysis AgentX, agentic workloads have become the main engine of inference growth — token consumption is orders of magnitude beyond chat scenarios, and inference compute has gone from "enough" to "never enough";
  • Supply premium on the new platform generation: Vera Rubin NVL72 has debuted on CoreWeave, and early-ramp pricing on new platforms is naturally elevated — which also raises the anchor for renewal prices on the previous generation (H100/H200/B200);
  • Power has become a hard constraint: CoreWeave's 4.2GW of contracted power shows the data center supply bottleneck has shifted from GPUs to power and racks; enterprises holding power contracts have no reason to cut prices.

2. What a 20% Rent Increase Means for TCO​

The site's TCO calculator splits total cost of ownership into five parts: purchase + energy + operations + network + discounting. Rent increases don't enter that model directly, but they change the "rental baseline" — the opportunity cost a build option must beat:

ScenarioBefore 20% Rent HikeAfter 20% Hike
Short-term elastic workloads (under 1 year)Renting winsRenting still wins (build deployment lead times can't catch up)
Steady inference workloads (2-3 years)Crossover zoneBuild starts to win (opportunity cost rises)
Training clusters (3 years+)Build winsBuild's advantage widens

Rules of thumb:

  • For workloads running 24/7 at full load for 2 years or more, a 20% rent increase is usually enough for building (even at a 1.5x purchase premium and with a PUE 1.3 energy model) to overtake renting within 30 months;
  • Tidal workloads (daytime peaks, idle nights) should still rent — under the assumption that a build pays a continuous 15% idle power draw, building almost never breaks even below roughly 50% utilization;
  • A hybrid strategy (owned baseline + rented peaks) is least sensitive to rent increases and is the robust play in the current interest-rate and power-price environment.

You can re-derive these conclusions in the TCO calculator: enter the "cloud rental unit price" at +20% and compare scenarios across purchase price, electricity price, and PUE. The default discount rate is 8%; purchase costs are not discounted, and annual electricity is discounted by 1.08^-y.

3. Pricing Implications for Domestic Compute​

Rent increases have a layer of impact on domestic AI chip purchasing decisions that is easy to overlook:

  • The rental market for domestic chips is not yet mature: compute from Ascend / Cambricon / Moore Threads is delivered mostly as appliances, full racks, and intelligent computing center allocations; public on-demand rental prices are scarce — so procurement comparisons naturally lean toward "build / full-system" models;
  • Relative TCO shift: a 20% NVIDIA rent increase raises the "relative attractiveness" of every domestic alternative, especially for inference workloads (actual market transaction prices for 910C / 950PR / P800 on the primary market are not public, but the full-system price gap versus dollar-priced cards is widening);
  • Supply cadence: DeepSeek betting on Ascend training and rumors of 160,000-unit 950DT purchases — top demand eats capacity first, and queue times for later buyers are lengthening. Deciding early has value in itself.

4. Takeaways​

  • Nebius raises H100/H200/B200 on-demand rates +20% from October; CoreWeave's contracted power at 4.2GW keeps locking in volume at high prices — rental market supply and demand remain tight;
  • Agentic inference + Rubin supply premium + power constraints: three forces pushing rents up, with no near-term reversal in sight;
  • Decision framework: steady workloads 2 years+ → the build window opens; tidal workloads → keep renting; hybrid strategies are most price-hike resistant;
  • What to watch: whether other clouds follow with price moves, formal Rubin rental pricing, and whether a public rental market for domestic compute emerges.

Further Reading​

References​

  • ZhiXun (media): Nebius raises AI chip rental prices; from October 1, H100/H200/B200 on-demand rates rise about 20% on average (2026-09-21)
  • Cailian Press / East Money: CoreWeave deploys multi-rack Vera Rubin NVL72 cluster, contracted power grows to 4.2 GW (2026-09)

This article is compiled from public reports; TCO conclusions depend on assumptions such as utilization, electricity price, and discount rate. Please re-compute with your own parameters using the TCO calculator.