AI News字数 2826阅读时长8 分钟

OpenAI 首批 Jalapeño 基准测试称其延迟更低、效率高于英伟达

OpenAI 表示,在早期 InferenceX 测试中,其 Jalapeño 推理芯片在延迟和每瓦性能方面优于英伟达 GB200 和 GB300 系统。

文章目录 · 11
  1. 一、首批 Jalapeño 基准测试显示了什么
  2. 二、结果颇具前景,但尚非完整的量产验证
  3. 三、Jalapeño 如何同时瞄准延迟与吞吐量
  4. 四、AI 同时参与了芯片设计和软件适配
  5. 常见问题
  6. 什么是 OpenAI Jalapeño?
  7. Jalapeño 比英伟达芯片更快吗?
  8. 测试了哪些模型?
  9. 开发者可以购买或租用 Jalapeño 硬件吗?
  10. Jalapeño 何时投入服务?
  11. 参考来源

OpenAI 于 2026 年 8 月 25 日公布了其定制 AI 推理芯片 Jalapeño 的首批实测性能结果。在三种公开语言模型上,该公司称,与用于对比的英伟达系统相比,Jalapeño 的峰值每瓦吞吐量高出 1.5 至 1.9 倍,端到端延迟低 1.7 至 3.6 倍。

这些结果使 Jalapeño 超越了 OpenAI 和博通在 6 月 24 日发布该处理器时提出的预期。当时,工程样片已达到目标频率和功耗,但 OpenAI 尚未公布详细性能数据。新测试涵盖 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。

Jalapeño 仍属于量产前硬件,而非面向客户销售的产品。OpenAI 计划在完成量产认证、改进软件栈并验证更多工作负载的同时,于 2026 年底前在自身基础设施中部署数量有限的系统。

一、首批 Jalapeño 基准测试显示了什么

OpenAI 使用 SemiAnalysis 的公开语言模型服务系统测评套件 InferenceX 测试 Jalapeño。不同于单一的理论算力指标,这些测试考察吞吐量与每位用户实际体验到的延迟之间的关系。

公布的对比采用名义工作负载:8,000 个输入 token、1,000 个输出 token,并进行单 token 预测。OpenAI 按各加速器公布的封装功耗额定值对性能进行了标准化:Jalapeño 为 700 瓦,英伟达 GB200 为 1,200 瓦,GB300 为 1,400 瓦。OpenAI 表示,在测试工作负载期间,Jalapeño 测得的持续功耗保持在或低于 550 瓦。

在 GPT‑OSS 120B 上,Jalapeño 的对比对象是 GB200。OpenAI 报告称,在峰值吞吐量下,Jalapeño 每千瓦每秒约可处理 85,448 个混合 token,而英伟达系统为 44,960 个——优势为 1.9 倍。端到端延迟为 1.03 秒,而非 1.80 秒;生成 token 之间的最短间隔为 0.69 毫秒,而非 1.87 毫秒。

DeepSeek R1 670B 的对比采用 GB300。Jalapeño 在峰值吞吐量下每千瓦每秒可处理 19,641 个混合 token,而对方为 11,781 个,约为其 1.7 倍。其报告的端到端延迟为 1.65 秒,而对方为 5.99 秒;token 之间的最短间隔为 1.43 毫秒,而非 5.90 毫秒。

对于同样以 GB300 为对比对象的 Kimi K2.5 1T,Jalapeño 达到每千瓦每秒 18,195 个混合 token,而对方为 11,862 个。端到端延迟为 1.56 秒,而非 5.31 秒;token 之间的最短间隔则从 5.48 毫秒降至 1.44 毫秒。

OpenAI 还展示了在将每个系统限制于此前竞争对手最佳 token 间隔点时的大幅吞吐量提升。这些数字在 GPT‑OSS 上达到 53.7 倍,在 DeepSeek R1 上达到 104.3 倍,在 Kimi K2.5 上达到 56.1 倍。这些是在特定工作点测得的交互性匹配结果,并不意味着每项 Jalapeño 工作负载都快几十倍。

在更广泛的测试范围内,OpenAI 将 Jalapeño 在高交互性工作负载上的优势概括为 2.1 至 4.1 倍。该芯片在全部三种模型上均位于每千瓦吞吐量的帕累托前沿,这意味着没有任何被比较的配置能同时提供更高吞吐量和更低延迟。

二、结果颇具前景,但尚非完整的量产验证

SemiAnalysis 开发了 InferenceX,并在 OpenAI 实验室中与该公司工程师一同观察了 Jalapeño 的运行。它确认,基准测试中的模型在 GSM8K 评测中取得了与英伟达硬件上相当的结果,从而降低了通过暗中牺牲模型输出质量来换取速度的风险。

不过,SemiAnalysis 强调,“所有数字均由 OpenAI 提供给我们”。其分析师见证了测试运行,但并未独立执行完整的 InferenceX 套件。他们也尚未看到 Jalapeño 在 AgentX 上的结果;AgentX 是一项围绕长上下文、多轮智能体工作负载设计的较新基准测试。

这一差异很重要,因为公布的 8K 输入、1K 输出测试并未完整覆盖请求路由器、前缀缓存、缓存管理系统和卸载基础设施等生产组件。在经过精心优化的单轮工作负载上的性能,未必能直接转化为面对可变提示、持续流量和多步骤智能体的在线服务表现。

对比所采用的代际也需要结合背景看待。GPT‑OSS 对比的是 GB200,而规模更大的 DeepSeek 和 Kimi 模型则与 GB300 对比。SemiAnalysis 认为,英伟达更新的 Vera Rubin 平台是更具相关性的竞争参照,因为 Rubin 和 Jalapeño 都采用 HBM4 级内存技术,且软件开发都处于相对早期阶段。

因此,这些测试表明,可运行的 Jalapeño 工程样片能够高效地运行多个大型非专有模型系列。但它们尚未证明其在 ChatGPT 和 API 生产流量下的集群级可靠性、总体拥有成本或性能表现。

三、Jalapeño 如何同时瞄准延迟与吞吐量

Jalapeño 是一款仅用于推理的加速器,而不是用于训练新基础模型的芯片。OpenAI 与博通围绕语言模型服务的不同阶段设计了它。

在预填充阶段,系统处理用户提示词,因此算力容量是核心限制因素。在解码阶段,系统逐 token 生成答案,对内存带宽施加更大压力。在处理器之间移动模型状态也可能带来另一项瓶颈,尤其是当一个请求跨越多个芯片时。

OpenAI 表示,Jalapeño 会尽可能将模型状态——包括生成期间使用的键值缓存——保留在本地,从而减少这种移动。算力、内存和网络在一个大型互连域内协同,使同一加速器池能够同时处理预填充和解码,而无需将这些阶段永久分配给不同硬件。

该设计旨在随着工作负载比例变化而保持效率。面向批处理的服务可能优先考虑总吞吐量,而交互式智能体可能需要快速生成 token,因为延迟会在连续的工具调用和推理步骤中累积。

博通提供了芯片实现、连接和网络方面的专业能力,包括其 Tomahawk 技术。Celestica 正在参与电路板、机架和系统集成。OpenAI 仍负责架构,以及由其 ChatGPT、Codex 和 API 工作负载所驱动的软件与硬件决策。

该公司尚未宣布销售 Jalapeño 芯片或系统的计划。OpenAI 硬件主管 Richard Ho 告诉 Axios,内部需求已经大到该公司无法设想向外部买家供货。因此,开发者将通过 OpenAI 服务间接接触 Jalapeño,而不是将其作为可购买的加速器。

四、AI 同时参与了芯片设计和软件适配

OpenAI 表示,AI 工具直接参与了 Jalapeño 的开发。从初始设计到制造流片,该公司在九个月内完成了芯片设计阶段。SemiAnalysis 将更广泛的时间线——从最初招聘团队到流片——估计为约 16 个月,因此这两个数字描述的是不同的起点,并不一定代表相互冲突的时间安排。

模型被用于探索实现方案、缩短设计和验证循环,以及优化算术电路。OpenAI 还将该处理器构建为一个可预测的编程目标,围绕本地张量、显式通信和同步机制设计,使 AI 系统能够协助在硬件上放置和调度工作。

工程团队使用搭载 GPT‑Astra 的 Codex,在两个月内使 GPT‑OSS、DeepSeek R1 和 Kimi K2.5——这些模型均未列入 Jalapeño 最初的量产计划——实现了高性能。对于部分 GPT‑OSS 注意力和混合专家模块,AI 生成的实现比人类专家编写的现有代码快 1.5 至 1.8 倍。OpenAI 明确将该结果限定于这些模块;它并非全模型加速结果。

OpenAI 预计将在 2026 年底前有限部署 Jalapeño,并在 2027 年扩大产能。第二代设计已进入高级开发阶段,第三代的工作也已开始。

该公司并未取代其外部供应商。它表示,由于 Jalapeño 本身无法满足其算力需求,英伟达和其他合作伙伴将继续为训练和推理提供加速器。眼下的运营考验在于:OpenAI 能否在完成量产认证后,将实验室中的效率增益复制到完整机架部署中,并经受混合客户流量的检验。

常见问题

什么是 OpenAI Jalapeño?

Jalapeño 是 OpenAI 首款定制 AI 加速器。它与博通共同开发,专门用于语言模型推理,而非模型训练。

Jalapeño 比英伟达芯片更快吗?

在 OpenAI 公布的 InferenceX 测试中,Jalapeño 的峰值每千瓦吞吐量更高,延迟也低于所比较的 GB200 和 GB300 配置。这些结果来自工程样片,尚非完整的量产基准测试。

测试了哪些模型?

OpenAI 使用名义上的 8,000 个输入 token 和 1,000 个输出 token 工作负载,测试了 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。

开发者可以购买或租用 Jalapeño 硬件吗?

不能。OpenAI 表示,它没有出售该芯片的计划,因为可用产能需要用于自身基础设施。开发者最终可能通过 OpenAI 托管的产品和 API 从中受益。

Jalapeño 何时投入服务?

OpenAI 计划在 2026 年底前开始有限的内部部署。量产认证、软件开发以及在更多模型上的测试仍在进行中。

参考来源

Share

分享这篇文章