8月25日,OpenAI公布了其专用推理芯片Jalapeño的首批官方测试结果,这些结果看起来是对Nvidia在AI加速器领域霸主地位的一次严峻挑战。根据我的数据,在公司的基准测试中,这款新处理器与基于Nvidia GB200和GB300的旗舰系统相比,每瓦计算效率高出1.5至1.9倍,延迟降低1.7至3.6倍。
对于要求最高的交互式场景,差距更加惊人:Jalapeño的性能比竞争对手高出2.1至4.1倍。OpenAI已宣布计划在2026年底前将该芯片部署到自家基础设施中,这可能从根本上改变其云服务的经济模式。
测试详细解析:三款模型,三场胜利
为了确保客观性,OpenAI使用了SemiAnalysis的公开基准测试InferenceX,该测试评估请求处理的完整流程,包括吞吐量、能耗和延迟。结果令人印象深刻:
GPT-OSS 120B对比GB200:Jalapeño的峰值性能为85,448 mixed TPS/千瓦,而Nvidia为44,960(优势为1.9倍)。完整延迟为1.03秒,对比1.8秒。
DeepSeek R1 670B对比GB300:效率差距达到19,641 mixed TPS/千瓦,对比11,781(1.7倍),延迟低3.6倍——1.65秒对比5.99秒。
Kimi K2.5 1T对比GB300:OpenAI自研芯片表现出18,195 mixed TPS/千瓦,对比11,862,延迟为1.56秒对比5.31秒。优势分别为1.5倍和3.4倍。
一个重要细节:计算中使用了制造商宣称的TDP指标。Jalapeño为700瓦,而GB200为1200瓦,GB300为1400瓦。同时,OpenAI指出,其芯片在测试中的实际持续功耗不超过550瓦,这使得结果更具说服力。
AI作为工程师:九个月的开发周期
Jalapeño的研发方法值得特别关注。OpenAI在从架构方案探索到算术模块验证和优化的所有阶段,都积极使用了自家AI模型。这使得从概念到可投产设计的时间缩短至九个月——这在半导体行业是前所未有的短周期。
此外,借助基于GPT-Astra的Codex工具,工程师在不到两个月的时间内,成功让芯片在三个最初不在生产计划中的开源权重模型上实现了高性能。对于GPT-OSS中的部分组件——attention和mixture-of-experts——AI生成的实现比手写版本快1.5至1.8倍。
战略背景:不仅仅是芯片
OpenAI首席财务官Sarah Friar将Jalapeño定位为涵盖数据中心、内存、网络和软件的垂直整合基础设施的关键组成部分。自研加速器使公司对推理成本拥有前所未有的控制力,并能根据性价比灵活分配负载。
值得注意的是,OpenAI并未放弃合作伙伴——其组合包括Microsoft、Nvidia、AWS、AMD、Broadcom等。这里的经济逻辑很简单:降低单位计算成本直接改善收入与基础设施支出的比率。Friar还引用了杰文斯悖论,认为效率提升不会导致计算消耗减少,而是会引发经济上可行的AI任务数量爆发式增长。
Jalapeño只是第一代产品。第二代已处于高级开发阶段,第三代正在设计中。首批芯片将在年底前进入OpenAI的基础设施。
我的分析结论:Jalapeño的成功不仅是技术上的胜利,更是行业范式转变的信号。如果OpenAI能够扩大生产规模并在实际运营中验证这些指标,我们将见证近年来对Nvidia在AI推理领域主导地位的首次重大挑战。问题只在于,OpenAI能否在大规模生产和需求不断增长的条件下保持这一优势。