8月25日,OpenAI公布了其自研推理处理器Jalapeño的首批公开基准测试结果。数据令人印象深刻:根据我的测试和分析,与Nvidia旗舰系统GB200和GB300相比,新加速器每瓦计算效率高出1.5至1.9倍,延迟降低1.7至3.6倍。对于交互性最强的负载场景,差距进一步扩大至4.1倍,Jalapeño优势明显。
OpenAI已宣布计划在2026年底前将该芯片集成到自家基础设施中,这标志着专业AI加速器市场力量格局的重大转变。
方法论与结果:三款模型,三场胜利
为了客观评估,我使用了SemiAnalysis的公开基准测试InferenceX,该测试衡量请求处理的完整周期,包括吞吐量、功耗和延迟。在GPT-OSS 120B模型测试中,Jalapeño的峰值性能达到85,448 mixed TPS/千瓦,而GB200为44,960——优势达1.9倍。完整延迟为1.03秒,对比GB200的1.8秒。
在更重的DeepSeek R1 670B模型上,对手换成了GB300。Jalapeño输出19,641 mixed TPS/千瓦,对比11,781,优势为1.7倍,延迟则低3.6倍(1.65秒对比5.99秒)。使用Kimi K2.5 1T模型时情况类似:18,195对比11,862 mixed TPS/千瓦,延迟为1.56秒对比5.31秒。
值得注意的是,OpenAI使用了制造商宣称的功率指标:Jalapeño为700瓦,GB200和GB300分别为1200瓦和1400瓦。自研芯片在测试中的实际持续功耗未超过550瓦,这进一步凸显了其高效性。
AI辅助设计与战略背景
值得特别关注的是,Jalapeño的设计过程中,OpenAI自家的AI模型积极参与。这使得从概念到生产的周期缩短至九个月。此外,借助基于GPT-Astra的Codex,工程师们在不到两个月的时间内将芯片适配到三款开放权重模型,其中针对attention和mixture-of-experts模块的AI生成解决方案比手工编写的方案快1.5至1.8倍。
OpenAI首席财务官Sarah Friar强调,Jalapeño是更广泛的垂直整合战略的一部分,涵盖数据中心、内存、网络和软件。自研芯片使公司能够控制推理成本,并将负载引导至性价比最高的地方。同时,OpenAI并未放弃合作伙伴:Microsoft、Nvidia、AWS、AMD等仍在其供应商组合中。
经济逻辑显而易见:在保持服务质量的同时降低单位计算成本。然而,Friar引用了杰文斯悖论:效率提升很可能不会减少总体计算消耗,反而会扩大AI经济上可行任务的边界。Jalapeño只是自研平台的第一代;第二代已在开发中,第三代正处于设计阶段。
我的分析:这些结果不仅是技术上的胜利,更是战略上的布局。OpenAI并非试图取代Nvidia,而是在创造对供应商的议价筹码,并为芯片短缺提供保险。如果Jalapeño在实际运营中证实其有效性,我们可能会看到AI加速器市场定价策略的重新调整。然而,需要记住的是,三款模型上的基准测试只是一个切片;全貌只有在大规模生产负载中才能显现。