OpenAI首款自研芯片在速度和能效方面超越NVIDIA
OpenAI公布了Jalapeño的首批详细性能数据,这是其首款专为AI推理设计的芯片。该公司在三款大语言模型上的自测显示,与作为对比的NVIDIA GB200和GB300系统相比,这款芯片的单位功耗峰值吞吐量高出1.5-1.9倍,端到端查询延迟低1.7-3.6倍。这并不意味着NVIDIA已被取代,但确实说明了为何最大的AI公司越来越希望自行设计更多硬件。
Jalapeño并不与训练芯片竞争
这是OpenAI首款自研推理芯片,这意味着它主要针对运行已经训练完成的模型进行了优化,而非从零开始训练新的大型模型。该公司将继续使用NVIDIA及其他合作伙伴的加速器进行训练和推理。
OpenAI使用了公开的InferenceX基准测试,并测试了三款模型:GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T。NVIDIA的GB200和GB300被用作对比系统。
在GPT-OSS 120B测试中,Jalapeño实现了每千瓦每秒85,448个输入和输出token的峰值吞吐量,而GB200为44,960。这使Jalapeño拥有约1.9倍的优势。端到端查询延迟分别为1.03秒和1.80秒。
DeepSeek R1产生了更大的延迟差距。Jalapeño在1.65秒内完成查询,而GB300需要5.99秒。Jalapeño的单位功耗峰值吞吐量达到每千瓦每秒19,641个输入和输出token,GB300则为11,781。对于Kimi K2.5,OpenAI测得Jalapeño的单位功耗峰值吞吐量约高1.5倍,总延迟低3.4倍。
这些是OpenAI自身的测量结果,并非来自独立实验室。能效数据也需要结合测试方法来解读。OpenAI使用加速器公布的额定功率对结果进行了归一化,而非在相同条件下测量每个竞品系统的实际功耗。
这款700 W芯片在测试中的功耗不超过550 W
Jalapeño的额定功率为700 W。根据OpenAI的数据,在所测试的工作负载中,实际功耗始终保持在550 W或以下。该公司在计算中采用了NVIDIA公布的GB200 1,200 W额定功率以及GB300 1,400 W额定功率。
单位功耗所完成的工作量在大型AI数据中心中正变得日益重要。电力容量、散热和电网接入与芯片供应一样,都可能限制服务器集群的增长。如果每千瓦能够处理更多查询,每个生成token或用户请求所对应的基础设施成本就会下降。
Jalapeño的架构围绕语言模型推理的不同阶段设计。初始输入处理,即prefill,主要是计算密集型任务。逐token生成响应,即decode,则更依赖内存带宽。在芯片和计算单元之间移动数据及模型状态同样会消耗时间。
OpenAI将处理器、内存、网络和软件设计为一个单一的集成系统,以减少不必要的数据移动。除其他方面外,该架构让响应生成期间使用的KV cache能够尽可能保持在本地。
AI参与了芯片本身的设计
AI在Jalapeño的开发中直接发挥了作用。根据OpenAI的数据,团队从初始设计到流片仅用了九个月。AI被用于探索实现方案、优化算术模块,以及加快验证和测量周期。
团队后来将Codex与GPT-Astra结合使用,为三款未列入原始生产计划的开放权重模型优化芯片。这项工作耗时两个月。在部分GPT-OSS注意力和专家混合模块中,AI生成的实现版本比早期由专家编写的版本快1.5-1.8倍。
这里有一个重要的限定:这一性能提升适用于选定的计算模块,而非整个GPT-OSS模型。
NVIDIA目前面临的问题不是Jalapeño,而是其背后的趋势
一款专用芯片不会在一夜之间重塑AI硬件市场。NVIDIA的优势不仅在于GB200或GB300的原始计算性能,还在于CUDA软件生态系统、网络、服务器架构,以及能够在广泛的模型和工作负载中使用同一平台的能力。
Jalapeño的意义在于其他方面。OpenAI完全了解自身服务产生的工作负载,并能够围绕这些工作负载优化硬件。Google、Amazon及其他主要云公司多年来一直遵循同样的逻辑。OpenAI携自研芯片进入市场,进一步增加了让AI计算更便宜、更节能的压力。
OpenAI计划在2026年底前将Jalapeño部署到自己的计算基础设施中。第二代芯片已处于深入开发阶段,第三代的架构也正在成形。
能效对于欧洲尤其重要。AI数据中心的增长意味着对电力容量和电网接入的直接竞争。如果专用推理芯片确实能够每千瓦提供大幅更多的有效工作量,其经济影响可能比任何一次在基准测试中战胜NVIDIA都更重要。
Jalapeño并不与训练芯片竞争
这是OpenAI首款自研推理芯片,这意味着它主要针对运行已经训练完成的模型进行了优化,而非从零开始训练新的大型模型。该公司将继续使用NVIDIA及其他合作伙伴的加速器进行训练和推理。
OpenAI使用了公开的InferenceX基准测试,并测试了三款模型:GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T。NVIDIA的GB200和GB300被用作对比系统。
在GPT-OSS 120B测试中,Jalapeño实现了每千瓦每秒85,448个输入和输出token的峰值吞吐量,而GB200为44,960。这使Jalapeño拥有约1.9倍的优势。端到端查询延迟分别为1.03秒和1.80秒。
DeepSeek R1产生了更大的延迟差距。Jalapeño在1.65秒内完成查询,而GB300需要5.99秒。Jalapeño的单位功耗峰值吞吐量达到每千瓦每秒19,641个输入和输出token,GB300则为11,781。对于Kimi K2.5,OpenAI测得Jalapeño的单位功耗峰值吞吐量约高1.5倍,总延迟低3.4倍。
这些是OpenAI自身的测量结果,并非来自独立实验室。能效数据也需要结合测试方法来解读。OpenAI使用加速器公布的额定功率对结果进行了归一化,而非在相同条件下测量每个竞品系统的实际功耗。
这款700 W芯片在测试中的功耗不超过550 W
Jalapeño的额定功率为700 W。根据OpenAI的数据,在所测试的工作负载中,实际功耗始终保持在550 W或以下。该公司在计算中采用了NVIDIA公布的GB200 1,200 W额定功率以及GB300 1,400 W额定功率。
单位功耗所完成的工作量在大型AI数据中心中正变得日益重要。电力容量、散热和电网接入与芯片供应一样,都可能限制服务器集群的增长。如果每千瓦能够处理更多查询,每个生成token或用户请求所对应的基础设施成本就会下降。
Jalapeño的架构围绕语言模型推理的不同阶段设计。初始输入处理,即prefill,主要是计算密集型任务。逐token生成响应,即decode,则更依赖内存带宽。在芯片和计算单元之间移动数据及模型状态同样会消耗时间。
OpenAI将处理器、内存、网络和软件设计为一个单一的集成系统,以减少不必要的数据移动。除其他方面外,该架构让响应生成期间使用的KV cache能够尽可能保持在本地。
AI参与了芯片本身的设计
AI在Jalapeño的开发中直接发挥了作用。根据OpenAI的数据,团队从初始设计到流片仅用了九个月。AI被用于探索实现方案、优化算术模块,以及加快验证和测量周期。
团队后来将Codex与GPT-Astra结合使用,为三款未列入原始生产计划的开放权重模型优化芯片。这项工作耗时两个月。在部分GPT-OSS注意力和专家混合模块中,AI生成的实现版本比早期由专家编写的版本快1.5-1.8倍。
这里有一个重要的限定:这一性能提升适用于选定的计算模块,而非整个GPT-OSS模型。
NVIDIA目前面临的问题不是Jalapeño,而是其背后的趋势
一款专用芯片不会在一夜之间重塑AI硬件市场。NVIDIA的优势不仅在于GB200或GB300的原始计算性能,还在于CUDA软件生态系统、网络、服务器架构,以及能够在广泛的模型和工作负载中使用同一平台的能力。
Jalapeño的意义在于其他方面。OpenAI完全了解自身服务产生的工作负载,并能够围绕这些工作负载优化硬件。Google、Amazon及其他主要云公司多年来一直遵循同样的逻辑。OpenAI携自研芯片进入市场,进一步增加了让AI计算更便宜、更节能的压力。
OpenAI计划在2026年底前将Jalapeño部署到自己的计算基础设施中。第二代芯片已处于深入开发阶段,第三代的架构也正在成形。
能效对于欧洲尤其重要。AI数据中心的增长意味着对电力容量和电网接入的直接竞争。如果专用推理芯片确实能够每千瓦提供大幅更多的有效工作量,其经济影响可能比任何一次在基准测试中战胜NVIDIA都更重要。