数据新闻 · 深度阅读

OpenAI公布Jalapeño推理系统细节,展示其在能效和延迟方面的性能指标

OpenAI在Hot Chips大会上公布了与博通共研的推理系统Jalapeño的详细信息。测试数据显示,Jalapeño在多个主流模型上的每瓦工作量和端到端延迟均优于对比系统,展示了其在提升AI处理效率方面的潜力。OpenAI计划将Jalapeño发展为持续的技术平台。

近期,业界关注的焦点之一是下一代大型语言模型(LLM)推理加速器的竞争态势。随着AI应用场景的日益复杂化和对能效比要求的提高,高性能、低延迟的专用推理芯片成为关键技术制高点。

在这一背景下,OpenAI公布了与博通共研的推理系统Jalapeño的细节和基准测试成绩,该信息是在Hot Chips大会上披露的。本次展示的核心目标是评估Jalapeño相对于当前市场顶尖推理处理器的性能表现。

根据公开资料,OpenAI使用InferenceX平台对Jalapeño的推理性能进行了测试,并将结果与英伟达GB200和GB300超级芯片系统进行了比较。这些对比测试覆盖了GPT-OSS 120B、DeepSeek R1以及Kimi K2.5 1T这三个不同的模型。

在能效方面,Jalapeño的性能指标表现出显著优势。数据显示,在上述三个模型上,Jalapeño每瓦完成的AI工作量达到了对比系统的1.5倍至1.9倍。此外,从吞吐量的角度看,Jalapeño在SemiAnalysis的InferenceX测试中,单用户token处理量和每千瓦吞吐量均超过了目前市面上的顶尖推理处理器。

除了绝对性能指标外,OpenAI也特别关注了延迟优化。数据显示,在GPT-OSS 120B、DeepSeek R1和Kimi K2.5 1T这三个模型上,Jalapeño的端到端延迟约为对比系统的28%至59%。这一结果表明,Jalapeño在降低预填充和通信阶段的延迟方面做出了重点优化,因为这两个环节被认为是推理性能的主要瓶颈。

OpenAI明确表示,Jalapeño相比目前最先进的产品实现了显著的性能提升,其优势在于能够在相同的电力消耗下处理更多AI工作负载并提供更快的响应速度。这种能效和速度的双重提升是本次展示的关键信息点。

从技术路线规划来看,OpenAI希望将Jalapeño发展成一个能够延续多代的技术平台,旨在实现AI产品、模型、芯片和内存的协同设计,构建一个完整的生态系统。这体现了其对长期技术布局的考量。

关于部署时间表方面,OpenAI计划在今年年底前“小规模”部署Jalapeño,并预计在2027年逐步扩大其部署规模。这一时间线为市场提供了一个初步的预期窗口期。

综上所述,本次公开资料展示了OpenAI与博通合作的成果,通过具体的性能数据和技术路线规划,描绘出Jalapeño系统在下一代AI推理加速器领域具有挑战性的定位。需要注意的是,所有关于Jalapeño的性能提升、部署计划等信息均来源于一次特定的公开场合公布,读者应将此视为基于该单一来源的初步评估。

信息来源

本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。