OpenAI 的 Jalapeño 芯片专为快速大规模推理而构建,基准测试显示
摘要
OpenAI 的 Jalapeño 芯片,与 Broadcom 共同开发,在 AI 推理基准测试中显示出显著的性能提升,超越了像 Nvidia 的 Blackwell 这样的尖端处理器。该芯片针对快速、高效的大规模推理进行了优化,部署将于 2026 年底开始。
在 SemiAnalysis 的 InferenceX 基准测试中,Jalapeño 的每个用户令牌数和每千瓦吞吐量均高于当前可用的尖端技术。
查看缓存全文
缓存时间: 2026/08/25 16:59
# TechCrunch:OpenAI的Jalapeño芯片专为大规模快速推理而生,基准测试显示
来源:https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/
在周二的Hot Chips大会上,OpenAI对Jalapeño芯片(https://openai.com/index/jalapeño-first-results/)进行了更详细的介绍,包括新系统的首批基准测试结果。在SemiAnalysis的InferenceX基准测试中,Jalapeño在每用户生成的token数量和每千瓦吞吐量方面均超越了目前最先进的推理处理器。
OpenAI硬件负责人Richard Ho在新闻电话会议中表示:“总结来说,结果显示其性能相较于现有最先进技术实现了极其显著的提升。Jalapeño能在单位功耗内处理更多AI任务,同时响应速度更快。它既能高效服务海量用户,也能实现极低延迟。”
值得注意的是,这一对比对象是Nvidia Blackwell系统——但当Jalapeño全面部署时,竞争对手可能已取得显著进展。Ho估计,Jalapeño将于2026年底“以极小规模”投入部署,更大规模的部署将在2027年实现。
Jalapeño于去年十月首次公布,由OpenAI与博通紧密合作开发,OpenAI自身的模型也参与了研发过程。该公司计划将Jalapeño打造为跨代平台,实现AI产品、模型、芯片与内存的协同开发。
得益于这种全栈技术方案,OpenAI得以针对推理流程中常导致卡顿的特定阶段进行优化。特别是,Jalapeño旨在最小化预填充与通信阶段的处理延迟——OpenAI指出这些阶段往往形成性能瓶颈。
“我们设计Jalapeño时致力于减少数据移动与通信延迟,”公司在发布结果的博客文章中表示。“这意味着模型状态(包括生成响应时使用的KV缓存)可以被显式放置并保持在本地,同时系统能为每个推理阶段动态调配计算、内存与网络资源的最优组合。”
*当您通过文章中的链接进行购买时,我们可能会获得少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*
Russell Brandom自2012年起从事科技行业报道,专注于平台政策与新兴技术领域。此前曾在The Verge和Rest of World工作,并为Wired、The Awl及MIT Technology Review撰稿。联系方式:[email protected] 或Signal账号 412-401-5489。
查看作者简介(https://techcrunch.com/author/russell-brandom/)
相似文章
OpenAI 发布首个AI处理器:Jalapeño
OpenAI 宣布了其首款定制AI推理芯片 Jalapeño,该芯片是与Broadcom合作开发的,旨在减少对Nvidia GPU的依赖,预计在2026年底前部署。
OpenAI与Broadcom发布专为LLM推理优化的芯片
OpenAI与Broadcom发布了Jalapeño,一款专为LLM推理定制的芯片,每瓦性能显著优于当前最先进水平,从零开始为当前及未来AI模型设计。
Jalapeño首次结果彰显AI推理行业领先速度与效率
OpenAI的Jalapeño定制推理芯片展现行业领先速度与效率,在各类AI模型中实现更高吞吐量与更低延迟。
OpenAI 推出其首款定制芯片,由 Broadcom 制造
OpenAI 发布了其首款自研推理处理器 Jalapeño,与 Broadcom 合作开发,旨在提升每瓦性能并减少对 Nvidia GPU 的依赖。
OpenAI称其Jalapeño芯片可实现比竞争对手更快的AI响应
OpenAI的Jalapeño AI芯片每瓦性能提升1.5至1.9倍,延迟低于Nvidia芯片,计划年底小批量部署开始