跳到主要内容

OpenAI Jalapeño新细节:13.4 PFLOPS 4-bit算力、232GB内存、用LLM在20个月内造出芯片

· 阅读需 5 分钟
Industry Research Team

据IEEE Spectrum 2026年9月14日报道,OpenAI的Jalapeño AI加速器正逐步揭开面纱。这不仅是一颗芯片的诞生,更是一场芯片设计方法论的革命——由LLM深度参与设计、不足百人团队、从架构概念到首次流片不足20个月。

Jalapeño的核心规格​

根据OpenAI官方口径,Jalapeño AI加速器的关键规格如下:

规格项Jalapeño参数
峰值算力最高13.4 petaflops(4-bit精度)
内存容量232GB
内存带宽15.4TB/s
设计定位专为LLM推理设计
合作伙伴博通(Broadcom)
研发周期从首个架构概念到首次流片不足20个月
团队规模平均不足100人

其中最引人注目的是4-bit精度下13.4 petaflops的峰值算力。这一数字定位清晰:Jalapeño并非追求通用计算的"全能选手",而是聚焦于大语言模型推理这一特定场景,在低精度计算上做到极致。232GB内存与15.4TB/s带宽的组合,则为KV Cache密集型的长上下文推理提供了吞吐保障。

性能对标:较GB300最高降低3.6倍延迟​

OpenAI引用的基准测试显示,在端到端延迟方面,Jalapeño较NVIDIA GB300最高降低3.6倍。对于推理业务而言,延迟直接决定用户体验——聊天机器人的首字响应、Agent系统的多轮迭代速度,都取决于每一毫秒。

需要指出的是,这一数据来自OpenAI自己的引用口径,测试条件与模型负载尚未完全公开。但即便打上折扣,一颗自研ASIC在特定推理负载上跑赢NVIDIA旗舰级GB300平台,本身就说明定制芯片在"场景足够聚焦"时确实具备结构性优势。

与博通合作:多代规划与吉瓦级部署​

Jalapeño由OpenAI与博通合作设计,规划了多代产品路线,目标直指吉瓦(GW)级部署。据公开报道,该芯片据称搭配AMD EPYC Turin主机CPU,而非完全依赖NVIDIA系统——这意味着OpenAI正在构建一条绕开NVIDIA生态的完整推理基础设施。

博通作为全球定制ASIC(XPUs)设计服务的头部玩家,此前已深度参与多家云巨头的自研芯片项目。OpenAI选择博通,等于站在了成熟的多项目晶圆与SerDes/IP积累之上,这也是20个月流片速度的重要支撑。

自定义芯片的适用条件​

Jalapeño的故事之所以成立,背后有一组苛刻的前提条件,并非所有公司都能复制:

  1. 海量且可预测的推理需求。ChatGPT的token消耗量巨大且增长曲线稳定,只有这种量级才能摊薄流片与迭代成本。
  2. 稳定的模型架构。Transformer架构多年未发生根本变化,才让针对特定计算模式的ASIC有了"押注"的价值。
  3. 全栈软件掌控。OpenAI同时拥有模型、推理框架和基础设施,软硬件协同优化可以贯穿到底。
  4. 足够的部署量。吉瓦级部署规划意味着单位芯片成本可以压到极低。

四个条件缺一不可。缺了需求,流片成本摊不掉;缺了架构稳定,芯片投产即过时;缺了软件栈,性能优势发挥不出来。

定制ASIC不会取代GPU​

一个常见的误读是"自研芯片将终结GPU"。但行业现实是:定制ASIC与GPU长期共存、各司其职。

  • 训练仍是GPU的主场。训练负载多变、需要频繁调试与实验,通用性至关重要。
  • 多模态与快速演进的架构同样属于GPU。新算子、新注意力变体往往先在GPU上验证。
  • 推理中负载高度稳定、模型固化的部分,才是ASIC的收割区。

换句话说,NVIDIA的GPU生态不会因为Jalapeño而瓦解,但推理市场的价值分配确实开始被重新切分。对NVIDIA而言,最大的挑战或许不是失去训练市场,而是越来越多头部客户把"最大的一块推理蛋糕"留给自己。

LLM设计芯片:方法论的革命​

比规格更值得关注的,是Jalapeño的设计方式。据IEEE Spectrum报道,OpenAI的LLM深度参与了芯片设计——从首个架构概念到首次流片不足20个月,团队平均不足100人。传统芯片设计动辄数百人团队、三到五年的开发周期,Jalapeño把这个数字压缩到了令人难以置信的程度。

LLM辅助设计带来的是研发效率的量级变化:架构探索空间的快速评估、RTL代码生成与验证、设计文档与工具链自动化。如果这套方法论被验证可复制,那么芯片设计的门槛将被实质性改写——未来不仅是"大厂造芯",而是"AI造芯"成为常态。

小结​

Jalapeño是2026年定制ASIC浪潮中最具标志性的产品之一:13.4 PFLOPS 4-bit算力、232GB内存、15.4TB/s带宽的规格专为LLM推理而生,与博通的合作、多代规划与吉瓦级部署展现了OpenAI摆脱NVIDIA依赖的决心。而LLM参与设计、不足百人团队、20个月流片的研发模式,其影响或许远超这颗芯片本身。定制ASIC不会取代GPU,但它正在重新定义推理经济的成本结构——对整个AI算力产业而言,这是一场刚刚开始的游戏。