跳到主要内容

15 篇博文 含有标签「AI Compute」

AI compute supply, demand and industry trends

查看所有标签

AI 芯片周报(2026年第42周):Gorgon Halo、千亿投资 OpenAI 与算力金融化

· 阅读需 5 分钟
Industry Research Team

2026年第42周(10月6日—10月10日),AI 芯片行业的关键词是"下沉"与"金融化":AMD 把 192GB 内存塞进 AI PC,NVIDIA 承诺最高 1000 亿美元投资 OpenAI,三星单季利润预计暴增 8 倍,高盛统计年内 AI 财团融资约 5000 亿美元。本篇按国际、国产、存储与系统、资本与市场四节汇总。

国际动态​

AMD 发布 Ryzen AI Max 400 "Gorgon Halo":最高 192GB 统一内存,覆盖 Pro 495/490/485 三个型号,单机可离线运行 1000 亿参数级大模型(官方口径支持 300B 级量化部署),在 NVIDIA RTX Spark 新品活动前两天发布,正面竞争意图明显。

NVIDIA 承诺最高 1000 亿美元投资 OpenAI:双方协议锚定 10GW 部署规模,首个 1GW 基于 Rubin 平台,计划 2026 H2 上线。芯片厂商向客户注资、客户用投资采购芯片的"循环"结构,成为本周算力金融化的标志性样本。

微软双线出击:Surface Laptop Ultra 发布($2,599,10 月 16 日发货),同期 DGX Station for Windows 开启预览——GB300 平台、748GB 统一内存、20 PFLOPS FP4。RTX Spark 笔记本预订同步开启,联想 YOGA Pro 15 RTX Spark 定档 10 月 16 日开售。

Daytona 基准新纪录:基于 Vera 平台的系统以 8×EPYC 9755 配置实现 10.8 秒创建千级沙盒,Agent 基础设施的启动时延被压缩到秒级。

事件厂商要点
Gorgon Halo 发布AMD192GB、Pro 495/490/485
千亿投资 OpenAINVIDIA10GW、首 GW Rubin 2026 H2
Surface Laptop Ultra微软$2,599、10-16 发货
Daytona 千沙盒 10.8 秒Vera 平台8×EPYC 9755

国产动态​

徐直军 HC2026 访谈给出三个关键口径:昇腾 950DT 年底实现规模供货;按华为口径昇腾在中国市场份额已超英伟达;当前第一约束是产能而非需求。结合站内 950 规格卡的市场报价数据(950DT 指示性报价超 25 万元、两月涨幅最高 50%),供给紧张可见一斑。

壁仞科技拟配售 1.3 亿股 H 股:配售价 31.08 港元,较市价折让 9.76%,国产 GPU 上市公司密集利用窗口期补充研发弹药。

奕行智能完成近 20 亿元融资:估值接近 150 亿元,边缘与推理芯片赛道持续吸金。

存储与系统​

三星 Q3 业绩预告炸裂:利润预计超 100 万亿韩元、同比增约 8 倍;12 层 HBM4E 已通过 NVIDIA 验证;同步公布 zHBM 与 400 层 V10 NAND 路线图。HBM 验证通过意味着 Rubin 后续代的存储供应格局进一步固化。

DRAM 价格创 15 年新高:本季度最高涨幅达 89%,内存占整机 TCO 比重持续攀升——站内 Rubin Ultra 卡记录的"内存已占 TCO 约 40%"正在被进一步刷新。

GlobalFoundries 与 TSMC 签订 20 亿美元 interposer 协议:先进封装产能成为继 HBM 之后又一个被提前锁定的环节。

Oracle 燃气卡车运电:据 Bloomberg 确认,Oracle 用卡车运送天然气维持多座数据中心运转,电力短缺已从预测变为运营现实。

资本与市场​

高盛统计:年内 AI 财团融资约 5000 亿美元。算力投资已形成"芯片商注资-客户采购-算力转售"的金融化闭环。

GMI Cloud 融资 6.68 亿美元,其中含 NVIDIA 2.23 亿美元股权投资——NVIDIA 的注资版图从中大型云厂商延伸到新兴算力运营商。

Super Micro 出口管制案同谋认罪,供应链合规风险开始向整机厂传导。

TSMC Q3 营收创纪录:9 月营收同比 +54.6%,全年 CAPEX 顶格至 560 亿美元,先进制程与先进封装双线扩产。

NVIDIA 计划投资 d-Matrix,推理 ASIC 新贵获得巨头背书;Upscale AI 发布 Token Fabric 网络方案;Gemini 4 "Argon" 即将发布,模型侧的新一代旗舰同样在倒计时。

下周关注​

  1. RTX Spark 笔记本 10 月 16 日首发:Surface Laptop Ultra 与联想 YOGA Pro 15 同日开售,首发实测数据与终端定价即将揭晓;
  2. 昇腾 950DT 规模供货节奏:徐直军"年底规模供货"承诺进入兑现观察期;
  3. Q3 财报季开启:TSMC 已开 SCE 头炮,存储三巨头与 GPU 供应链财报将密集落地;
  4. Rubin NVL72 出货爬坡:首个 1GW Rubin 部署能否如期在 2026 H2 上线。

小结​

第 42 周的主线是"算力金融化":NVIDIA 千亿美元投资 OpenAI、高盛统计的 5000 亿财团融资、三星 8 倍利润,共同指向一个事实——AI 算力已经从技术生意变成资本生意。与此同时,Gorgon Halo 与 Surface Laptop Ultra 的发布说明竞争正在向端侧下沉,而 DRAM 创 15 年新高、Oracle 运气运电则提醒所有人:上游的存储与电力约束,比任何发布会都更真实地决定着 2027 年的算力供给。

EPYC Venice 256核登陆 2nm:AMD 服务器 CPU 的 AI 时代打法

· 阅读需 6 分钟
Industry Research Team

在 AI GPU 抢走所有头条的年代,服务器 CPU 的战争并未结束,而是换了一种打法。AMD 把 Zen 6 架构的 EPYC Venice 推上 2nm,堆到 256 核,并让它成为 Helios 机架的主机侧大脑——这是一份关于"AI 时代 CPU 该干什么"的答案。

全球首款 2nm 数据中心 CPU​

EPYC Venice 于 2026 年 1 月 6 日在 CES 发布,是第六代 EPYC 数据中心处理器,也是全球首款采用 2nm 工艺的高性能处理器。苹果会在消费级处理器上首发台积电 2nm,但数据中心 2nm 的头衔属于 AMD——在 x86 阵营中,这是自 Zen 架构崛起以来 AMD 第一次在制程节点上同时领先所有对手。

其核心规格如下:

规格参数
CPU 架构Zen 6 / Zen 6C
制程工艺台积电 2nm(N2)
核心数量最高 256 核(Zen 6C 版)
线程数量最高 512 线程
L3 缓存1024MB(1GB)
CCD 配置8 个 Zen 6C CCD(每 CCD 32 核)
内存通道16 通道,单路带宽 1.6TB/s
PCIe6.0
封装接口全新 SP7
发布时间2026 年 1 月 6 日(CES 2026)
量产时间2026 年 5 月(已投入量产)

Venice 系列包含两个版本:高密度 Zen 6C 版本最高 256 核(8 个 CCD、每 CCD 32 核、1GB L3),面向高密度数据中心;标准 Zen 6 版本最高 192 核(16 个 CCD、每 CCD 12 核、768MB L3),面向通用数据中心。单核性能提升达 70%。

256 核的密度哲学:AI 节点中 CPU 的角色重定义​

Zen 6C 的设计哲学浓缩在一个数字里:每 CCD 32 核,比上代 Zen 5C 的 16 核直接翻倍。这让 AMD 只用 8 颗 CCD 就实现了 256 核——更少的芯粒数量意味着更低的封装成本、更简化的互联拓扑与更好的良率控制。这是典型的 chiplet 时代密度打法:不追求单核极限,而是追求单位封装面积与单位成本下的核心密度。

为什么 AI 数据中心需要 256 核?答案藏在 CPU 角色的转变里。在传统数据中心,CPU 是绝对主角;而在 Helios 这样的 AI 机架中,每托盘 4 颗 MI455X GPU 配 1 颗 Venice,CPU 的职责变成了数据搬运、内存管理、系统控制编排——它不再是算力的提供者,而是算力的"交通调度员"。

这个角色对 CPU 的要求恰好与 256 核匹配:数据预处理、Tokenization、KV Cache 管理、网络协议栈、存储 I/O,这些工作高度并行且不依赖单核性能,核心数量就是吞吐量。16 通道内存提供的 1.6TB/s 带宽(Turin 的 2 倍)与升级的 PCIe 6.0、CPU-GPU 互联带宽翻倍,都是为了同一个目标:让 GPU 永远不缺数据。在 AI 工厂里,一颗喂不饱 GPU 的 CPU,就是最贵的瓶颈。

2nm 双厂布局:台湾与亚利桑那的地缘对冲​

Venice 的另一个关键进展是产能布局:它已在台积电 2nm 产线启动量产,并将延伸至台积电美国亚利桑那工厂。这使 AMD 成为首个实现美国本土 2nm 量产的 x86 服务器 CPU 厂商。

这步棋的价值在地缘层面。美国政府对本土先进制程产能的战略诉求日益强烈,超大规模云厂商的采购决策中"美国制造"的权重持续上升;亚利桑那产线让 AMD 在满足主权 AI 与政府订单时拥有对手难以复制的选项。与此同时,台湾产线保障了主力产能与成本效率——双厂并行既是对冲地缘风险,也是对冲单一产线的产能与意外风险。对于一款要装进 OpenAI、Meta、微软数 GW 级 AI 工厂的 CPU,供应链韧性本身就是产品力。

竞争格局:Intel 的份额流失与 Vera 的正面压力​

服务器 CPU 市场的竞争压力来自两个方向。

一个方向是传统对手 Intel。分析师普遍认为 Intel 在服务器 CPU 市场持续丢失份额,甚至出现"卖出 Intel"的分析口径。在 AI 数据中心的建设热潮中,每新建一个机架,主机侧 CPU 的采购决策就发生一次——而 Helios 这类 AMD 自家机架方案,天然把 Venice 带进了原本属于 Xeon 的领地。

另一个方向来自 NVIDIA。AI 工厂正在重新定义 CPU 的形态:NVIDIA 为 Rubin 平台配套了自研的 Vera ARM CPU(88 核),试图用"GPU 加自家 CPU"的整合方案替代独立服务器 CPU。竞争压力已经有数字化的呈现——根据 Daytona 的 Vera CPU 智能体基准测试,Vera 在千个沙盒场景中耗时 10.8 秒,而 EPYC 9755 需要 88.4 秒。这一测试虽不能代表所有负载,但它揭示了一个真实趋势:NVIDIA 正在用专为 AI Agent 工作负载设计的 CPU 架构,向"AI 工厂该用什么 CPU"的话语权发起冲击。

AMD 的应对是把 Venice 做成开放生态的一部分:它不只服务 Helios,也通过 Dell、HPE、Supermicro、Lenovo 的 OEM 渠道进入各种第三方 AI 服务器。与 Vera 的封闭整合路线不同,Venice 的卖点是 x86 软件兼容性与部署灵活性——存量数据中心不需要重写一行代码。

小结​

EPYC Venice 的故事不是"更多核心、更先进制程"的常规升级,而是一次角色转型的样板:CPU 从数据中心的主角变成 AI 工厂的调度中枢,256 核与 1.6TB/s 内存带宽是为"数据搬运工"这个新岗位定制的装备。2nm 双厂布局提供了地缘对冲,x86 兼容性守住了开放生态的基本盘。它面对的挑战同样明确——向上要顶住 Vera 这类 AI 原生 CPU 架构的挤压,向下要继续收割 Intel 丢失的份额。AI 时代的 CPU 战争,才刚刚进入下半场。

GB300 Grace Blackwell Ultra 全解:从 20 PFLOPS 桌面超算到数据中心旗舰

· 阅读需 6 分钟
Industry Research Team

同一颗 GB300 Grace Blackwell Ultra 芯片,既能撑起 350 万美元级的数据中心机柜,也能塞进一台放在办公桌上的 DGX Station。2026 年 10 月微软活动上预览的 DGX Station for Windows,让这个"双面故事"变得更加完整。本文依据站内芯片数据库,梳理 GB300 在 Blackwell 家族中的定位、桌面与数据中心的产品分层,以及 WSL 桥接对 Windows 企业市场的意义。

GB300 在 Blackwell 家族中的定位​

GB300 是 NVIDIA 第三代 Grace Blackwell 超级芯片,2025 H2 发布。其代际演进脉络清晰:

指标GH200 (2023-Q3)GB200 (2024-Q4)GB300 (2025 H2)
GPUH100B200B300 Ultra
CPUGrace 72 核Grace 72 核Grace 72 核
GPU 内存96GB HBM3192GB HBM3e288GB HBM3e
GPU 带宽3.35 TB/s8 TB/s10 TB/s
NVLink 域内60 TB/s130 TB/s130 TB/s
网络ConnectX-7 400GConnectX-8 800GConnectX-9 1.6T
FP4 sparse(单 GPU)N/A(FP8 2 PF)10 PF15 PF
TDP(GPU)1000W1000W1400W

GB300 超级芯片 = 2 颗 B300 Ultra GPU + 1 颗 Arm Grace CPU(72 核 Neoverse V2),通过 900 GB/s 的 NV-HBI 高速接口配对。据站内芯片数据库,单 Superchip FP4 sparse 算力 30 PFLOPS、FP8 dense 7.5 PFLOPS、GPU 侧总显存 576GB HBM3e,Superchip 模块单价约 7-8 万美元。

B300 Ultra:288GB HBM3e 的推理特化​

B300 Ultra(Blackwell Ultra)是 Blackwell 的中期升级版本,2026 年 1 月正式出货。据站内芯片数据库:

  • 显存:288GB HBM3e(12-Hi 堆叠),相比 B200 的 192GB 提升 50%,可单卡加载 FP16 的 70B 模型并保留 100GB+ 给 KV Cache;
  • 算力:FP4 稀疏 30 PFLOPS、FP8 密集 7 PFLOPS,相比 B200 均提升约 56%;
  • 实测:DeepSeek-R1 Prefill 吞吐 22,476 TGS,相比 H200 提升 8 倍;短输出场景提升 20 倍。

需要说明的是,站内 b300-ultra 卡按单卡口径记录 FP4 稀疏 30 PFLOPS,而 gb300 卡的代际对比表按单 GPU 口径记 15 PFLOPS(Superchip 两颗合计 30 PFLOPS),两个数据源口径存在差异,读者引用时需注意区分。B300 的制程仍为台积电 4NP,升级重心放在显存容量与 FP4 精度上——这正是"中期升级"的典型特征:架构不动,围绕推理经济性做增量。

NVL72 机柜:数据中心旗舰形态​

36 颗 GB300 组成 NVL72 机柜(72 颗 B300 Ultra + 36 颗 Grace),据站内芯片数据库:

项目配置
HBM 总量20.7 TB HBM3e
LPDDR5X 总量34.6 TB
NVLink 5 域内130 TB/s 全互联
ConnectX-9 出口72× 1.6T = 115 Tb/s
FP4 sparse 总算力1.08 EFLOPS
机柜 TDP约 120kW(含冷却)
价格约 330 万美元/机柜

ConnectX-9 是这代机柜的隐性升级:单端口 1.6 Tb/s 相比 ConnectX-8 翻倍,延迟低于 0.5 微秒,支持 NVLink over IB 跨机柜互联。8 个机柜可组成 NVL576 域——576 颗 B300 Ultra 共享 130 TB/s 互联,是业界最大单一 NVLink 域,对万亿参数 LLM 训练至关重要。云端租用方面,行业口径(Nebius)B300 的租用价格约为 9.50 美元/GPU 小时,站内芯片数据库另记录 AWS 8 卡 B300 实例(p6-b200.48xlarge)单 GPU 小时价 11.70 美元,不同供应商价差明显。

在 token 成本维度,站内数据给出了关键洞察:B300 单价虽高,但以 Llama 70B 推理测算,FP4 量化下单 token 成本相比 H100 低约 61%——单价高不等于用得贵。

DGX Station:20 PFLOPS 的桌面超算​

2026 年 10 月的微软活动上,NVIDIA 预览了 DGX Station for Windows,核心配置:

  • 芯片:GB300 Grace Blackwell Ultra Desktop Superchip;
  • 一致性内存:748GB(252GB HBM3e + 496GB LPDDR5X);
  • 算力:最高 20 PFLOPS FP4;
  • 模型能力:可在本地运行约 1 万亿参数模型;
  • 软件:Linux 工具链经 WSL(Windows Subsystem for Linux)访问;
  • 上市:2026 Q4,ASUS、Dell、HP、Lenovo 推出整机。

产品分层:1 PFLOPS 与 20 PFLOPS 之间​

DGX Station 的出现补全了 NVIDIA 桌面产品线的断层。站内芯片数据库记录的 RTX Spark(RTX DGX Spark)定位约 1 PFLOPS 级 FP4 算力的紧凑桌面开发机,而基于 GB300 Desktop Superchip 的 DGX Station 直接把桌面算力抬到 20 PFLOPS——20 倍的分层差距,对应着完全不同的用户画像:

维度RTX SparkDGX Station (GB300)
算力约 1 PFLOPS FP4最高 20 PFLOPS FP4
内存统一紧凑内存748GB 一致性内存
目标场景个人开发、微调小型模型本地万亿参数推理、企业级开发
价格量级消费级/准专业级高端工作站

WSL 桥接:Windows 企业市场的钥匙​

DGX Station for Windows 最值得玩味的细节是"Linux 工具链经 WSL 访问"。CUDA 生态的主场在 Linux,此前企业若要在 Windows 环境做本地 AI 开发,往往需要双机或虚拟化方案。WSL 桥接意味着:

  1. 企业 IT 无需改变管理习惯:Windows 域、组策略、合规审计体系原样保留;
  2. 开发者无需迁移工作流:PyTorch、TensorRT-LLM 等工具链在 WSL 内原生运行;
  3. 数据不出本地:金融、医疗、政务等对数据合规敏感的行业,获得了一条"本地跑万亿参数模型"的合规路径。

这与 GB300 数据中心侧的统一内存设计一脉相承:Grace 上 480GB LPDDR5X 与 B300 上 288GB HBM3e 统一寻址,CPU 与 GPU 共享一致性内存池。桌面版把同样的架构哲学浓缩进一台工作站——数据搬运越少,推理经济性越好。

小结​

GB300 家族展示了 NVIDIA 的典型打法:一颗芯片,从数据中心机柜到桌面工作站全栈铺开。数据中心侧,B300 Ultra 用 288GB HBM3e 和 FP4 精度把推理 token 成本压到 H100 的四成以下;桌面侧,DGX Station 用 20 PFLOPS FP4 和 748GB 一致性内存把"本地大模型"从口号变成 Q4 可买的产品。而 Rubin R200 已在 H2 2026 接棒数据中心旗舰,GB300 的价值窗口正在收窄——但它建立的"统一内存 + 桌面到机柜分层"产品范式,将由 Vera Rubin 平台延续下去。

服务器 CPU 变天:EPYC Venice 256核 2nm 量产 vs Intel 三度涨价仍失份额

· 阅读需 5 分钟
Industry Research Team

服务器 CPU 市场正在经历一次角色重定义:AMD 用 2nm 制程和 256 核密度继续扩大领先,Intel 被迫靠涨价在需求中求生,而 NVIDIA 自研 Vera CPU 则带着 AI 专用设计入场。AI 服务器里 CPU 不再是主角,但恰恰因此,它的选型逻辑被彻底改写。

AMD Venice:2nm 量产 + 256 核密度登顶​

AMD 第六代 EPYC "Venice"(Zen 6 架构,最高 256 核)已经在台积电 2nm 产线启动量产,这是行业首批进入 2nm 量产的处理器产品之一。更值得关注的是,量产正在从台积电延伸至 AMD 的亚利桑那工厂——先进制程的美国本土化,对政府采购和主权 AI 项目是重要的加分项。

项目EPYC Venice(6th Gen)说明
架构Zen 6新一代核心
最高核心数256 核服务器 CPU 密度新纪录
制程TSMC 2nm,延伸至亚利桑那工厂首批 2nm 量产处理器
角色定位Helios 机架 CPU,配套 72×MI455XAI 机架主机侧
下一代"Verano",已为 AI 工作负载预留设计设计即前馈

Venice 还有两层战略价值:其一,它是 Helios 机架(72 颗 MI455X)的配套 CPU,AMD 的 GPU 机架方案因此获得了"自家 CPU+自家 GPU"的垂直整合能力;其二,下一代 "Verano" 已经为 AI 工作负载预留设计,说明 AMD 在产品定义阶段就开始为 AI 节点做优化,而不是拿通用服务器芯片顺手兼容。

Intel:年内三度涨价,份额仍在流失​

Intel 的处境则截然不同。10 月 5 日起,Intel 对 CPU 提价 10%——这是年内第三次涨价,驱动因素是 AI 需求带动的产能紧张。但涨价并没有止住份额流失:多家分析师在报告中持续给出卖出的建议口径,认为 Intel 服务器 CPU 的市场份额下滑尚未见底。

维度AMDIntel
制程2nm 量产(Venice)制程追赶中
核心数路线256 核密度登顶密度竞赛落后
价格策略产品迭代驱动年内三度涨价(累计幅度未公开)
服务器份额持续提升持续流失(分析师建议卖出口径)
价格支撑机架级方案带动AI 服务器配套 x86 需求托底

值得注意的悖论是:Intel 涨价的底气部分恰恰来自 AI——AI 服务器爆发也拉动了配套 x86 CPU 的需求,产能紧张让 Intel 敢于连续提价。但"涨价求生"的另一面是,客户在 AI 服务器 CPU 选型上的议价空间被压缩,这反而给了 AMD 和 NVIDIA 更多切入机会。

Vera 入场:AI 节点上的 CPU 重新定义​

NVIDIA 自研的 Vera CPU 是第三个变量。Daytona 基准测试给出了一个惊人的对比:Vera 跑千沙盒仅需 10.8 秒,而 AMD 旗舰 EPYC 9755 需要 88.4 秒——约 8 倍的差距。

对比项NVIDIA VeraAMD EPYC 9755
Daytona 千沙盒10.8 秒88.4 秒(约 8 倍耗时)
设计目标专为 AI 节点设计通用服务器负载
配套内存Vera SCF + 1.5TB LPDDR5X传统 DIMM 路线

Vera 的设计思路与通用服务器 CPU 完全不同:SCF 互联加 1.5TB LPDDR5X 的组合,是专为 AI 节点上"数据搬运 + 调度"的角色优化的。在 Grace/Vera 与 GPU 紧耦合的架构里,CPU 的传统性能指标(如 SPEC 系列)重要性下降,而内存带宽、与加速器的耦合效率成为新的评价维度。

分析:AI 服务器中 CPU 角色的重定义​

AI 服务器里,CPU 不再是算力的主角,而是被压缩到三个角色:主机侧调度(内核、虚拟化、作业分发)、数据搬运(存储/网络与 GPU 之间的通路)、以及配套生态(x86 软件兼容性)。这带来了三强格局下的不同打法:

  • AMD 走密度路线:用 256 核 + 2nm 的硬件优势,同时服务传统虚拟化和 AI 机架主机侧,Venice 与 Helios 的绑定让"买 AMD GPU 就配 AMD CPU"成为默认选项;
  • Intel 涨价求生:利用产能紧张和 x86 生态惯性提价保收入,份额换取现金流,等待下一代产品翻盘;
  • NVIDIA 自研入场:Vera 不参与通用服务器竞争,只在 AI 节点上用专用设计建立垂直优势,Daytona 8 倍的差距就是其叙事武器。

对采购方的影响:三强博弈叠加产能紧张,意味着锁量窗口正在关闭。Intel 年内三度涨价已经发出信号——服务器 CPU 的价格曲线在 2026 年是向上的。有大批量采购计划的企业,应尽快与供应商锁定价格和交期;同时,AI 集群主机侧 CPU 的选型需要重新评估,传统"EPYC 对标 Xeon"的通用跑分逻辑,在 Vera 这类 AI 专用 CPU 出现后已不再充分。

小结​

服务器 CPU 市场的竞争维度正在迁移:从通用性能转向"AI 节点适配度"。AMD Venice 以 2nm + 256 核的量产优势延续密度路线,并借 Helios 机架实现 CPU/GPU 协同;Intel 连续三次涨价反映的是产能紧张下的议价权,而非竞争力回升;NVIDIA Vera 用 Daytona 基准 8 倍的成绩宣告 AI 专用 CPU 的独立赛道成立。对采购方而言,2026 年的关键词是"锁量"和"重估"——锁定涨价前的采购窗口,重估 AI 集群中主机侧芯片的技术选型标准。

Vera CPU 深度:SCF + 1.5TB LPDDR5X,NVIDIA 自研 CPU 的野心

· 阅读需 7 分钟
Industry Research Team

当所有人盯着 Rubin R200 的 50 PFLOPS FP4 时,真正决定这台机器推理经济性的,可能是一颗 CPU。Vera——NVIDIA 首次全面自研核心的数据中心 CPU,用 88 个 Olympus 核心、第二代 SCF 一致性结构和 1.5TB LPDDR5X,重新定义了"AI 工厂的主机处理器"。本文依据站内芯片数据库与智能体基准实测,拆解 NVIDIA 从外购 Arm 核到自研 SCF 的演进逻辑。

从 Grace 到 Vera:自研之路的三级跳​

NVIDIA 的 CPU 战略经历了三个阶段:GH200/GB200 时代的 Grace CPU 基于 72 核 Neoverse V2 公版 Arm 核心,本质是"外购核心 + 自研互联";GB300 延续了这一代 Grace;而 2026 年 GTC 发布的 Vera 则完成质变——核心、片上互连、内存子系统全部自研。据站内芯片数据库,Vera 的核心规格如下:

规格参数
CPU 架构ARM 架构(自研 Olympus 核心)
指令集ARMv9.2(完全兼容)
核心数量88 个 Olympus 核心
线程数量176 个线程(空间多线程)
单核性能前代产品的 2 倍
最大内存容量1.5 TB(LPDDR5X)
内存带宽1.2 TB/s
互联技术NVLink-C2C(1.8 TB/s)
片上互连第二代 SCF(3.4 TB/s 对分带宽)
发布时间2026 年 3 月 17 日
量产时间2026 年下半年

SCF:88 核无延迟扩展的底座​

SCF(Scalable Coherency Fabric,可扩展一致性结构)是 Vera 最值得细看的技术。第二代 SCF 提供 3.4 TB/s 对分带宽,采用片上网格 + 统一缓存设计,可无延迟扩展 88 个核心。

对分带宽(bisection bandwidth)是衡量片上互连质量的关键指标:它表示把芯片切成两半时,两半之间的总通信带宽。88 核的大芯片如果对分带宽不足,核心越多内耗越大。第二代 SCF 用网格拓扑让任意核心间的通信路径趋于均匀,配合统一缓存避免一致性流量的长距离穿梭——这正是 Vera 敢于采用单体计算芯片设计(而非多小芯片拼接)的底气:避免跨小芯片通信延迟,在所有核心满载时保持稳定延迟和吞吐量,性能可预测性强。

1.5TB LPDDR5X:把内存子系统当主武器​

Vera 将 SCF 与高达 1.5TB 的 LPDDR5X 内存子系统结合。对比上一代 Grace 的规格变化一目了然:

指标Grace(GB200/GB300)Vera提升
内存容量480GB LPDDR5X最高 1.5TB LPDDR5X约 3 倍
内存带宽512 GB/s1.2 TB/s约 2.3 倍
CPU-GPU 互联NV-HBI 900 GB/sNVLink-C2C 1.8 TB/s2 倍
核心数72 核 Neoverse V288 核 Olympus+22%

更关键的是系统级设计:LPDDR5X 与 GPU 的 HBM4 可视为单一一致性内存池。这意味着数据不再需要在"CPU 内存"和"显存"之间显式搬运,两个物理上分离的内存子系统在软件视角下是一体的。对推理业务,这带来两个直接收益:KV 缓存卸载——不常用的注意力上下文可以下沉到 LPDDR5X 侧,把昂贵的 HBM4 带宽留给热点数据;多模型高效执行——多个模型实例共享同一内存池,切换与加载开销大幅降低。

Daytona 实测:智能体时代的 CPU 门槛​

2026 年 10 月 10 日公布的 Daytona 智能体基准测试,给 Vera 的实际能力提供了量化注脚。智能体负载的特点是海量并发沙盒的创建与销毁——恰恰考验 CPU 的内存容量、一致性与调度效率:

测试项VeraAMD EPYC 9755差距
1000 沙盒上线10.8 秒88.4 秒约 8 倍
峰值智能体任务吞吐13.3 任务/秒——
2000 沙盒上线27.4 秒——

8 倍的沙盒上线速度差距说明:智能体负载对 CPU 的要求已与通用计算分道扬镳——容量大(1.5TB 装下海量沙盒状态)、带宽高(1.2TB/s 喂饱并发)、一致性结构强(88 核高效协作)。站内芯片数据库同时记录,Vera 的软件环境运行速度相比传统架构 CPU 提升最高 50%,满负载下强化学习评估周期可缩短 50%。

与 Groq 3 LPX 的异构分工​

Vera 所在的 Rubin 平台还有一位非常规队友:NVIDIA 收购 Groq 后推出的 Groq 3 LPX。据站内芯片数据库,LPX 机架集成 256 颗 LPU,聚合 128GB 片上 SRAM,聚合带宽高达 40 PB/s,官方口径的能效优势显著(35× perf/W vs H100 推理)。在 Rubin 平台的分工中,GPU 承担训练与 prefill,Groq 3 LPX 专攻智能体解码阶段的低延迟输出——而 Vera 则是这一切的调度中枢。prefill 吃算力、decode 吃带宽、调度吃一致性与容量,三种负载由三种架构分别消化,这正是"每 token 经济学"推导出的异构架构必然性。

Vera vs EPYC Venice:服务器 CPU 的新战场​

Vera 的出现让 NVIDIA 与 AMD 在服务器 CPU 领域正面相遇。据站内芯片数据库,AMD EPYC Venice(2026 CES 发布)是全球首款 2nm 数据中心 CPU:

指标NVIDIA VeraAMD EPYC Venice(Zen 6C)
核心88 个自研 Olympus最多 256 个 Zen 6C
制程未公开台积电 2nm(N2)
内存1.5TB LPDDR5X16 通道 DDR5
单路带宽1.2 TB/s1.6 TB/s
L3 缓存—1GB
卖点NVLink-C2C、CPU-GPU 一致性通用性、x86 生态

两者的定位差异明显:EPYC Venice 是通用数据中心 CPU 的极致(256 核、x86 生态、Helios 机架中与 MI455X 组队),而 Vera 是 AI 专用 CPU——它不做通用服务器生意,只为 AI 工厂的主机负载优化。Vera 甚至支持硬件级 FP8 计算,是全球首款支持 FP8 精度的 CPU,并支持全机密计算的硬件级安全隔离。竞争的天平取决于一个问题:AI 工厂的 CPU 采购,会不会整体从通用服务器预算中剥离?如果会,Vera 绑定 Rubin GPU 的销售模式将是护城河;如果不会,EPYC 的生态广度仍难撼动。

小结​

Vera CPU 标志着 NVIDIA 完成了从"用别人的核心攒超级芯片"到"自研全套主机平台"的跃迁:SCF 的 3.4TB/s 对分带宽解决了 88 核扩展难题,1.5TB LPDDR5X 与 HBM4 构成的一致性内存池重构了推理数据流,Daytona 实测的 8 倍沙盒优势则证明智能体负载确实需要一颗不一样的 CPU。它的野心不在挑战 x86 的通用服务器王座,而是重新划定一条边界——AI 基础设施中,CPU 是 GPU 子系统的一部分,而不是独立采购的商品。这条边界能否成立,将决定未来五年服务器市场的版图。

RTX Spark 笔记本开订、DGX Station 登陆 Windows:NVIDIA 把 AI 超算搬上办公桌

· 阅读需 5 分钟
Industry Research Team

在旧金山举行的微软 Windows AI 与 Surface 活动上,NVIDIA 一手开启 RTX Spark 笔记本预订,一手预览 DGX Station for Windows——从 1 PFLOP FP4 的笔记本到 20 PFLOPS FP4 的桌面工作站,AI 算力正在从数据中心一路铺到办公桌。

RTX Spark 笔记本正式开订​

在微软于旧金山举行的 Windows AI 与 Surface 活动上,NVIDIA 宣布 RTX Spark 笔记本正式开启预订,首批产品将于 10 月 16 日(周五)发货;紧凑型桌面产品则计划在 11 月跟进上市。

OEM 阵容覆盖了几乎所有主流 PC 品牌:Acer、ASUS、Dell、HP、Lenovo、Microsoft(Surface Laptop Ultra)、MSI、Gigabyte 全部在列。从发布即有如此完整的品牌背书来看,RTX Spark 显然不是一款演示性产品,而是要成长为一个完整的终端新品类。

Blackwell RTX + Grace CPU:数据中心架构下沉终端​

RTX Spark 的硬件方案可以概括为"把 Grace Blackwell 的思路压缩进 PC":

  • GPU:基于 Blackwell 架构的 RTX GPU,最高 6144 个 CUDA 核心;
  • CPU:最多 20 核的 Grace CPU;
  • 互联:CPU 与 GPU 之间提供 600 GB/s 高速链路;
  • 算力:最高 1 PFLOP FP4;
  • 内存:最高 128GB 统一内存,CPU 与 GPU 共享同一内存池;
  • 软件:运行完整 CUDA 栈。

其中"统一内存 + 完整 CUDA 栈"是两个关键点:前者决定了本地能装下多大的模型,后者决定了云端训练的代码可以低成本迁移到本地调试,开发者不必为桌面场景另学一套工具链。

DGX Station for Windows 首次预览​

如果说 RTX Spark 面向个人开发者,那么同场预览的 DGX Station for Windows 则瞄准了更高一层的需求。它基于 GB300 Grace Blackwell Ultra Desktop Superchip,拥有 748GB 一致性内存,算力最高可达 20 PFLOPS FP4,目标是让用户在本地运行约 1 万亿参数的模型。

对 Linux 生态的兼容也给出了务实答案:Linux 工具链可以通过 WSL(Windows Subsystem for Linux)访问。DGX Station for Windows 将于 Q4 上市,由 ASUS、Dell、HP、Lenovo 四家推出。

Surface Laptop Ultra 与内存挤压隐忧​

作为活动的另一主角,Surface Laptop Ultra 已于 10 月 7 日开启预订,最高配备 128GB 统一内存——这个容量已经接近入门级推理服务器的水平。

但 DIGITIMES 提出了一个不容忽视的问题:AI PC 的内存供给正在被服务器需求挤压。在内存厂商的优先级排序中,服务器 DRAM 需求被放在首位,AI PC 依赖的 LPDDR5X 供给承压。在存储供应紧张的背景下,128GB 统一内存的 AI PC 能否稳定供货,本身就是一个变数。

从云端到桌面的算力分层​

把 NVIDIA 目前的桌面产品线摆在一起,可以清晰看到一条算力分层路线:

产品形态关键规格定位
DGX Spark桌面 AI 超算64GB 统一内存、1 PFLOP FP44,999 美元,个人与小团队原型验证
RTX Spark 笔记本笔记本最高 6144 CUDA 核心 + 最多 20 核 Grace CPU、最高 128GB 统一内存随身开发与调试
DGX Station for Windows桌面工作站GB300 Grace Blackwell Ultra Desktop Superchip、748GB 一致性内存、最高 20 PFLOPS FP4本地运行约 1 万亿参数模型

这条路线的逻辑是:云端负责大规模训练与生产推理,桌面负责原型验证、微调与敏感数据场景,笔记本负责日常开发与演示。当模型越做越大、数据合规要求越来越严,"把算力放在身边"的价值正在上升。

Windows CUDA 原生化与 WSL 的务实路线​

过去十几年,CUDA 的主战场在 Linux 服务器上,Windows 开发者在工具链上长期处于跟随位置。RTX Spark 与 DGX Station for Windows 意味着完整 CUDA 栈第一次以原生姿态大规模进入 Windows 桌面场景。

而 WSL 桥接 Linux 工具链的安排,则是一种典型的务实路线:既照顾 Windows 用户的使用习惯,又不要求现有 Linux 工作流推倒重来。对于在 Windows 环境中做模型开发和内部工具的企业开发者来说,迁移成本被明显降低;对 NVIDIA 而言,这等于把整个 CUDA 开发者生态延伸到了全球存量最大的桌面操作系统上。

小结​

RTX Spark 笔记本开订与 DGX Station for Windows 预览,标志着 NVIDIA 把 AI 算力的故事延伸到了最后一米:从数据中心,到桌面工作站,再到背包里的笔记本。1 PFLOP FP4 到 20 PFLOPS FP4 的分层算力、128GB 到 748GB 的统一内存、WSL 桥接的 Linux 工具链,共同构成了一条完整的桌面 AI 开发路径。剩下的悬念有两个:一是 LPDDR5X 供给紧张会不会卡住 AI PC 的出货节奏,二是 11 月的紧凑型桌面和 Q4 上市的 DGX Station 能否如期落地。

AI芯片周报(2026年第41周):2nm量产竞速、存储新范式与机架级大战

· 阅读需 4 分钟
Industry Research Team

2026年第41周(9月28日—10月6日前后),AI芯片行业密集事件爆发:NVIDIA N1X冲击PC市场、Intel年内第三次涨价、AMD Helios量产、MLPerf新纪录、存储新范式、国产涨价与上市潮。本篇按国际、国产、存储与系统、资本与市场四节汇总。

国际动态​

NVIDIA N1X发布(10-04):NVIDIA发布N1X PC处理器,直接竞争Intel与AMD的PC处理器市场,当日两家股价各下跌4.2%。N1X基于RTX Spark芯片、与微软合作打造,2026年秋季上市。

Intel CPU涨价10%(10-05生效):这是Intel自2025年以来的第三次涨价,受AI需求和产能紧张驱动。

AMD Helios量产(9-18报道):MI455X首批出货目标Q3末,OpenAI 6GW、Meta 6GW、Anthropic合作兑现中,微软为首批客户之一。

MLPerf Inference v6.1(9-16):Vera Rubin NVL72首秀,跑Qwen3-VL较GB300最高提升3.7倍;AMD MI350以512卡创下575万tokens/秒的纪录。

事件时间要点
N1X发布10-04Intel/AMD股价各跌4.2%,2026秋季上市
Intel涨价10%10-05生效年内第三次涨价
Helios量产9-18报道MI455X首批Q3末出货
MLPerf v6.19-16Rubin NVL72较GB300最高3.7倍

国产动态​

华为昇腾950:智算集群云服务9月30日国内商用,11月30日全球商用;昇腾960超节点引入NPO技术、支持4096卡、提供8E FP8算力。

平头哥真武V900(9-22云栖大会):216GB显存、1200GB/s带宽,2027年Q1量产;同期发布倚天720/730 CPU路线图。

国产芯片涨价(路透):寒武纪690与昇腾950DT涨价20%-50%,HBM成本上涨是主要驱动。

燧原科创板上市(9-11):开盘上涨188.37%,市值达1764亿元。

摩尔线程"庐山":年底亮相,3A渲染性能提升15倍、光追50倍、AI 64倍。

存储与系统​

SK海力士:9月17日发布HBF/PIM/eSSD/SALT-KV组合,9月18日成立SK hynix Ventures投资生态;美光9月15日发布超密度服务器内存模组;AWS Annapurna×NVIDIA推进NVHBM定制内存;长鑫存储据路透报道筹备进军NAND。

电网与能效:Emerald AI、Google、NVIDIA于9月16日成立AEMA(先进能源与算力联盟);NVIDIA DSX MaxLPS助力Lambda实现同功率下token吞吐+24%、每瓦性能+23%。

存储玩家动作
SK海力士HBF/PIM/eSSD/SALT-KV + 设立Ventures
美光超密度服务器内存模组
AWS×NVIDIANVHBM定制内存
长鑫存储筹备进军NAND

资本与市场​

份额格局:据Counterpoint口径,国产AI芯片从2022年的近乎零份额,到2025年已达41%;其中华为昇腾约占国产市场的62%。

股价与估值:同期美股芯片板块上涨,NVIDIA收涨2.54%、AMD涨超6%。

下周关注​

  1. 昇腾950云服务全球商用倒计时:11月30日全球商用节点临近,海外部署进展值得跟踪;
  2. Helios首批交付:MI455X能否兑现Q3末首批出货目标;
  3. Q4国产新卡发布窗口:年底前后国产厂商新品密集期,摩尔线程"庐山"亮相在即。

小结​

第41周的主线是"三重加速":算力侧(N1X、Helios、MLPerf新纪录)节奏空前,存储侧(HBF、NVHBM、SALT-KV)范式更新,供给侧(Intel涨价、国产涨价20%-50%)紧张加剧。国产份额41%的数据说明格局重塑已在发生,Q4将是验证兑现能力的关键窗口。

5GW、10GW成为新单位:Anthropic与OpenAI的算力军备竞赛

· 阅读需 5 分钟
Industry Research Team

当算力的计量单位从"多少张卡"变成"多少吉瓦",AI竞争的本质已经改变:大模型公司正在变成"能源公司+基建公司+模型公司"的三位一体。

5GW与10GW:新计量单位的诞生​

2026年9月的行业报道显示,AI算力竞赛进入了一个全新的量级:Anthropic的目标是在今年年底拥有约5GW的可用算力,而OpenAI明年的规划则是约10GW。

这两个数字意味着什么?5GW大致相当于数百万张高性能GPU同时满负荷运转所需的电力,而10GW已经接近一座大型核电站的装机容量。就在一年前,行业讨论的还是"十万卡集群";如今,头部玩家谈论的是吉瓦级园区。算力竞赛的计量单位,已经从GPU的数量彻底转向了电力的功率。

从"买卡"到"买电厂"​

这种变迁背后,是AI产业价值链的整体上移:

  • 能源成为第一约束。先进AI芯片供应在改善,但变电站、输电线路和发电容量的建设周期以年计。谁拿到电力指标,谁就拿到训练下一代模型的入场券。
  • 基建能力成为核心竞争力。数据中心不再是租用IDC机房那么简单,而是涉及选址、并网、冷却系统乃至自有发电能力的系统工程。
  • 模型公司与芯片公司深度绑定。OpenAI与博通合作开发Jalapeño自研芯片,并规划多吉瓦级部署,这已经不是"采购算力",而是"定制算力供应链"。

20-30MW小数据中心为何成为抢手货​

一个耐人寻味的细节是:Anthropic和OpenAI两家还在争抢20-30MW级别的小型数据中心,Anthropic甚至向SpaceX租用算力。

原因很直接——大容量数据中心从规划到投运周期太长,而模型训练和推理需求等不起。20-30MW的小站点虽然容量有限,但胜在可快速拿容量:现有楼宇改造、电力接口现成、数月内即可上线。对于急需算力缺口的大模型公司,这批"小快灵"资源成了战略物资,甚至在二级市场上被反复转租、溢价争夺。向SpaceX租算力则更为激进——当地面电力不够快时,头部玩家已经开始评估包括星载算力在内的非常规选项。

算力军备竞赛的经济账​

这场竞赛的规模有多大?根据Bain 2026技术报告的口径,AI硬件市场2025年约为312.1亿美元,2026年预计达到384.9亿美元。而吉瓦级算力园区背后,是单笔动辄数十亿美元级别的芯片采购与多年期电力合约。

算力的本质正在从"IT设备"变成"重资产基础设施"——它的融资方式(项目融资、长期租约)、回报模型(算力利用率、每token成本)都越来越像电厂和通信网络,而不是服务器机房。

对AI芯片厂商意味着什么​

吉瓦级竞赛重塑了芯片厂商的客户结构,谁绑定大客户谁受益的格局愈发清晰:

厂商核心绑定关系算力绑定规模
NVIDIA微软 / OpenAI深度绑定OpenAI,吉瓦级部署主力供应商
AMDOpenAI / Meta / AnthropicOpenAI 6GW、Meta 6GW、Anthropic(多年期协议)
OpenAI(自研)博通合作Jalapeño多吉瓦级部署规划
云厂商自研AWS Trainium、Google TPU等服务自有平台负载

对芯片厂商而言,这带来两个深远影响:其一,订单变得极度集中,一张吉瓦级订单足以改变一家芯片公司的营收曲线,NVIDIA与AMD过去一年股价的分化某种程度上就是绑定关系的映射;其二,芯片设计开始围绕客户的电力预算优化,每瓦性能取代峰值算力成为核心指标——因为客户的稀缺资源不是芯片,而是那几吉瓦的电。

小结​

5GW和10GW不只是两个数字,它们标志着AI竞争进入了"基建时代":电力取代芯片成为第一约束,20-30MW小数据中心成为快速补位的战略资源,大模型公司集能源、基建、模型三重身份于一身。对AI芯片产业来说,这意味着订单向深度绑定大客户的产品集中、设计向每瓦性能倾斜。算力军备竞赛的下半场,比的不是谁的芯片跑分更高,而是谁能先把电厂建起来、把电接进来。

Groq 3 LPX 全面量产:三星 4nm 代工、单机架 315 PFLOPS FP8,英伟达把 LPU 变成 Vera Rubin 的第七颗芯片

· 阅读需 5 分钟
Industry Research Team

本文基于 NVIDIA 官方产品页、2026 年 3 月 GTC 架构博客及第三方基准数据整理;性能口径为厂商架构对比,实际收益需以自测为准。

英伟达确认,Groq 3 LPX——Vera Rubin 平台的「第七颗芯片」——已进入全面量产,由三星平泽园区代工。这是继 2025 年 12 月英伟达斥资约 200 亿美元获得 Groq 非独占 IP 授权与核心工程团队之后,这笔交易第一次以量产硅的形式落地。

对推理硬件格局而言,这是一次范式级事件:英伟达第一次把「别家定义的专用推理架构」纳入自家旗舰平台,且不是外挂销售,而是深度协同设计。

一、Groq 3 LPU 芯片与 LPX 机架:规格速览​

单颗 Groq 3 LPU(4nm,三星代工):

项目数值
编译器管理的片上 SRAM500 MB
SRAM 带宽150 TB/s
片间 scale-up 带宽2.5 TB/s(96 条 chip-to-chip 链路,每条 112 Gbps)

单个 LPX 机架(32 个 1U 液冷托盘,每托盘 8 颗 LPU):

项目数值
LPU 总数256 颗
FP8 算力315 PFLOPS
片上 SRAM 总量128 GB
SRAM 聚合带宽40 PB/s
机架内 scale-up 带宽640 TB/s
DDR5 内存12 TB(承载大模型权重)

每颗 LPU 500MB 的 SRAM 看起来不大,但乘上 256 颗、再叠加 40PB/s 的聚合带宽,构成了「确定性低延迟解码」的物理基础——LPU 的设计哲学正是用编译器静态调度片上 SRAM,彻底消除推理解码阶段的内存取数停顿,而这恰恰是 GPU 推理最典型的瓶颈。

二、AFD:注意力与 FFN 分家,GPU 和 LPU 各干各的​

LPX 不是替代 GPU,而是与 Vera Rubin NVL72 组成异构系统,核心是 AFD(Attention-FFN Disaggregation,注意力-前馈解耦):

  1. Rubin GPU 负责 prefill 与 attention——在大上下文上构建 KV cache、执行注意力层,吃 HBM 容量与高吞吐;
  2. Groq 3 LPU 负责 FFN / MoE 专家层解码——延迟敏感、模式可预测,恰好是 SRAM 确定性调度的主场;
  3. 中间激活在两个引擎间逐 token 交换,由 NVIDIA Dynamo 编排路由,GPU 算每一层注意力,LPU 算每一层前馈,协同完成每个输出 token。

这套分工的逻辑很清晰:智能体应用消耗的 token 量可达传统 AI 应用的 15 倍,瓶颈从「能不能算完」变成「能不能以稳定低延迟持续吐 token」。让 HBM 大容器去跑 attention、让 SRAM 确定性引擎去跑 decode,各取所长。

三、实测与官方口径​

  • 第三方实测(Artificial Analysis):Gemma 4 31B、100K token 上下文下,LPX 输出约 3400 tokens/s——单 token 间隔低于 1 毫秒,长上下文智能体场景的交互感质变
  • 官方架构对比:与 LPX 组合后,Vera Rubin NVL72 对万亿参数模型的每兆瓦吞吐最高提升 35 倍;「高价值 token」场景下每瓦收入机会最高 10 倍
  • 首发客户:Nebius 率先部署 LPX 机架扩展其 token 产能;CoreWeave 已在生产环境用 Spectrum-X Multiplane 连接 Vera Rubin 机架

需要强调:35 倍/10 倍是特定高交互工作点的架构对比数字,不是普适结论。训练、大吞吐批量推理、需要 CUDA 生态灵活性的负载,GPU 仍是正解;LPX 的主场是「单用户交互延迟即产品」的场景——智能体循环、实时编码助手、长上下文对话。

四、三个行业信号​

1. 专用推理芯片被收编,而非对抗。 过去 LPU 是「GPU 挑战者」的叙事,现在变成了 Vera Rubin 的组成部分。推理硬件的终局可能不是一种架构赢,而是「GPU + 专用解码引擎」的异构组合成为标配。对其他推理芯片创业公司(Cerebras、Etched 等),这既是天花板抬高的证明,也是「要么被集成、要么找差异化」的警示。

2. 三星代工拿到高端 AI 订单。 在台积电几乎垄断 AI 主芯片的背景下,三星 4nm 承接 LPX 量产意义重大——叠加此前特斯拉 AI6 的 2nm 订单,三星代工有望在 2027 年重回全年盈利。

3. 推理经济性进入「按 MW 定价」时代。 当厂商开始用 tokens/MW 和每瓦收入讲故事,算力选型的核心 KPI 已经从峰值算力(TFLOPS)彻底转向单位能耗的 token 产出。这与我们在 TCO 计算器 里内置的功耗-电费模型逻辑一致:峰值参数好看的芯片,未必是每 token 成本最低的芯片。

小结​

Groq 3 LPX 量产标志着推理硬件进入「GPU 管吞吐、LPU 管延迟」的异构时代。对于正在选型推理集群的团队,建议把工作负载拆开评估:批量离线推理留在 GPU,交互式长上下文智能体值得单独测算 LPX 类方案的单位成本。拿不准的话,先用 TCO 计算器 跑一遍两种架构的 3 年持有成本再拍板。

(本文性能数据来自 NVIDIA 官方架构对比与 Artificial Analysis 第三方实测,实际部署请以自测为准。)

GPU 租金又涨了:Nebius 10 月起 H100/B200 随需租金上调约 20%,自建 vs 租用的天平在移动

· 阅读需 5 分钟
Industry Research Team

据芯智讯 9 月下旬报道,Nebius 宣布10 月 1 日起 H100 / H200 / B200 随需(on-demand)租金平均上调约 20%。同月,财联社报道 CoreWeave 截至 8 月 11 日已签约电力增至 4.2 GW,并将"继续以更高价格签约新算力"。这是本轮 AI 周期里租赁市场连续第 N 次提价——对采购方来说,自建与租用的 TCO 天平正在移动。本文用站内 TCO 计算器的口径拆解这笔账。


1. 涨价的三个推手​

  • agentic 推理需求爆发:从 MLPerf v6.1 到 SemiAnalysis AgentX,agentic 负载成为推理增长主引擎——token 消耗量级远超聊天场景,推理算力从"够用"变成"永远不够";
  • 新一代平台的供给溢价:Vera Rubin NVL72 已在 CoreWeave 首发上线,新平台早期产能爬坡期定价天然偏高,同时抬高上一代卡(H100/H200/B200)的续租价格锚点;
  • 电力成为硬约束:CoreWeave 4.2GW 签约电力的表述说明——数据中心供给瓶颈已从 GPU 转向电力与机架,电力在手的企业没有理由降价。

2. 租金上涨 20% 对 TCO 意味着什么​

站内 TCO 计算器把总拥有成本拆成采购 + 能耗 + 运维 + 网络 + 折现五段。租金上涨不直接进入这个模型,但它改变了"租用基准线"——即自建方案要击败的机会成本:

场景租金涨 20% 前涨 20% 后
短期弹性负载(不足 1 年)租用占优租用仍占优(自建部署周期追不上)
稳定推理负载(2-3 年)临界区自建开始占优(机会成本抬高)
训练集群(3 年+)自建占优自建优势扩大

直觉化判断:

  • 24/7 满载跑 2 年以上的负载,租金上调 20% 通常足以让自建(哪怕按 1.5 倍采购溢价、含 PUE 1.3 能耗模型)在 30 个月内反超;
  • 潮汐型负载(白天高峰、夜间空闲)仍应租用——自建方案按 15% 空闲功耗持续付费的假设下,利用率低于约 50% 时自建几乎不可能回本;
  • 混合策略(自建基线 + 租用峰值)对租金上涨的敏感度最低,是当前利率与电价环境下的稳健解。

上述结论可在 TCO 计算器中自行复算:把"云租用单价"按 +20% 输入,对比采购价、电价与 PUE 两个情景。折现率默认 8%,采购成本不折现、逐年电费按 1.08^-y 折现。

3. 国产算力的定价含义​

租金上涨对国产 AI 芯片的采购决策有一层容易被忽略的影响:

  • 国产卡的租用市场尚未成熟:昇腾 / 寒武纪 / 摩尔线程的算力主要以一体机、整机柜和智算中心配额形式交付,公开随需租价稀缺——采购对比天然偏向"自建/整机"模型;
  • 相对 TCO 变化:NVIDIA 租金上涨 20% 等于抬高了所有国产替代方案的"相对吸引力",尤其是推理负载(910C / 950PR / P800 一级市场的实际成交价未公开,但整机报价对美元卡的价格差在扩大);
  • 供给节奏:DeepSeek 押注昇腾训练、16 万颗 950DT 采购传闻——头部需求先吃掉产能,后来者的排队周期在拉长,早决策本身有价值。

4. 小结​

  • Nebius 10 月起 H100/H200/B200 随需租金 +20%;CoreWeave 签约电力 4.2GW 且继续高价锁量——租赁市场供需仍紧;
  • agentic 推理 + Rubin 供给溢价 + 电力约束,三力推高租金,且短期难回头;
  • 决策口径:稳定负载 2 年+ → 自建窗口打开;潮汐负载 → 继续租用;混合策略最抗涨价;
  • 看什么:其他云厂商是否跟进调价、Rubin 租赁的正式定价、国产算力是否出现公开租用市场。

相关阅读​

参考资料​

  • 芯智讯:Nebius 上调 AI 芯片租用价格,10 月 1 日起 H100/H200/B200 随需租金平均上涨约 20%(2026-09-21)
  • 财联社 / 东方财富:CoreWeave 推出多机架 Vera Rubin NVL72 集群,已签约电力增至 4.2 吉瓦(2026-09)

本文基于公开报道整理;TCO 结论依赖利用率、电价、折现率等假设,请以 TCO 计算器按自身参数复算为准。