Skip to main content

Cerebras 晶圆级引擎:号称30倍于GPU的速度与100亿美元 OpenAI 电力协议

· 6 min read
Industry Research Team

当整个行业还在围绕 GPU 的 HBM 容量与机柜规模做文章时,Cerebras Systems 走了一条从根上不同的路:把整片晶圆做成一颗"芯片"。这家公司宣称其晶圆级引擎比 GPU 快 30 倍,并与 OpenAI 签署了一份高达 100 亿美元的电力协议(有效期至 2028 年)。在分析师将 Cerebras 与 AMD 并列为"未来十年可能跑赢 NVIDIA"的两家公司的当下,替代架构赛道正在从概念验证走向商业兑现。

晶圆级架构:从站内卡看 WSE-3 的底子​

根据站内 Cerebras WSE-3 芯片卡,晶圆级引擎的硬件基础如下:

项目WSE-3(CS-3 系统)
发布2024 年 3 月
制程TSMC 5nm
晶体管数4 万亿
核心数900,000
片上 SRAM44 GB
FP16 稀疏算力125 PFLOPS
TDP(系统)15 kW
形式CS-3 整机系统(液冷)

作为对比,一颗常规旗舰 GPU 的晶体管数量在千亿级——WSE-3 的 4 万亿晶体管相当于数十颗 GPU 被熔铸在同一片晶圆上。900,000 个核心之间通过片上网络直连,配合 Weight Streaming 技术,从架构上消除了大模型训练的两大痛点:内存墙与通信开销。传统集群训练中,跨芯片的梯度同步消耗大量时间;而在晶圆级引擎上,这些"通信"变成了片上走线。

为什么晶圆级能做到快 30 倍​

晶圆级架构的原理优势集中在两点:

第一,无 reticle 限制。 传统芯片的尺寸受光刻机 reticle(曝光区域)约束,单 die 面积存在物理上限,算力扩展只能靠多芯片组网。Cerebras 通过晶圆拼接技术在整片 300mm 晶圆上制造出统一的计算平面,绕开了这个物理天花板。

第二,内存贴近计算。 44GB 片上 SRAM 与计算核心同晶圆集成,SRAM 延迟是纳秒级,带宽远超 HBM。对照行业趋势——NVIDIA 收购 Groq 后主推 SRAM-only LPU、d-Matrix 主推数字 SRAM 推理芯片——"内存贴近计算"正在成为推理架构的共同信仰,而 Cerebras 在这条路上已经走了三代。

代价同样清晰:散热与良率。15 kW 液冷整机只是单系统功耗;晶圆上任何一个缺陷区域都必须被冗余设计屏蔽,良率管理难度远超常规 die。这也解释了为什么晶圆级引擎至今仍是高投入机构的选择,而非大众市场商品。

100 亿美元电力协议:新的合作计量单位​

Cerebras 与 OpenAI 的协议核心不是芯片采购,而是电力——至 2028 年提供 100 亿美元规模的电力保障。AI 算力产业的稀缺资源排序已经悄然变化:芯片可以加急生产,数据中心可以快速搭建,但电网接入与发电能力是按年计的硬约束。"电力协议"正在取代"芯片订单"成为巨头间合作的计量单位,这与近期 Anthropic、OpenAI 动辄以吉瓦(GW)为单位锁定算力的趋势一脉相承。

配套动作同样值得注意:Cerebras 与 AMD 合作降低成本,借力 AMD 的封装与系统生态摊薄晶圆级方案的高昂制造成本。而 2026 年 10 月 2 日,Cerebras 又演示了解耦(disaggregated)芯片架构,实现推理吞吐 5 倍增益——将计算与内存功能在系统层面分离编排,为晶圆级架构打开了推理场景的新增长空间。

替代架构赛道全景:融资密度陡增​

Cerebras 不是孤军。2026 年以来,GPU 之外的架构创新密集获得资本加持:

公司架构方向融资/合作动态
Volantis光子推理系统8,800 万美元 A 轮
CScale加速器光互连1.45 亿美元 C 轮
Efficient Computer数据流架构9,700 万美元 B 轮,估值 6.5 亿美元
Q/C Technologies纳米光子 OPU与 Sandia 国家实验室合作
Cerebras晶圆级引擎OpenAI 100 亿美元电力协议

其中光计算路线尤其活跃。Volantis 的光子推理系统采用类 Face ID 的垂直腔面发射激光器(VCSEL)连接 AI 芯片与内存,用光替代电信号突破互连带宽瓶颈;Q/C Technologies 与 Sandia 国家实验室的纳米光子 OPU 则把光学计算单元推向更深的技术腹地。光互连解决的是"数据搬运"这个所有非 GPU 架构的公共瓶颈——当计算本身已经足够快,通信才是真正的墙。

GPU 之外的第三条路:先在推理落地​

训练市场的替代架构尝试屡屡受挫,但推理市场正在成为新架构的温床,原因有三:

  1. 成本敏感。LLM serving 的成本结构决定了每 token 推理成本的微小改善会被海量请求放大为巨大商业价值,架构创新有了明确的回报标尺。
  2. 架构可固化。训练需要灵活支持不断演进的模型结构,而推理负载相对稳定,SRAM 密集、流水线化的专用架构可以"固化"模型结构换取极致效率——这正是 LPU、数据流架构的共同打法。
  3. 无生态包袱。推理可以通过 OpenAI 兼容 API 层屏蔽底层差异,绕开 CUDA 的护城河;训练则深度依赖框架与算子生态,迁移成本极高。

分析师将 Cerebras 与 AMD 并列为未来十年可能跑赢 NVIDIA 的两家,逻辑正在于此:AMD 靠性价比与开放生态蚕食存量市场,Cerebras 靠架构范式在增量市场(极致推理速度)开疆拓土。

小结​

Cerebras 的 30 倍速度宣称与 100 亿美元电力协议,共同标记了 AI 算力竞争的第二曲线:当 GPU 路线的边际改善趋缓,晶圆级、光计算、数据流架构正在从实验室走向商业化。晶圆级架构用"无 reticle 限制 + 内存贴近计算"换取极致速度,代价是散热与良率的持续攻坚;"电力协议"则揭示算力竞争的底层已是能源竞争。对行业而言,最现实的判断是:GPU 之外的第三条路会先在推理场景落地——那里成本敏感、负载稳定、生态门槛最低,也是 Cerebras、Volantis、Efficient Computer 们共同的战场。