8月25日,OpenAI公布首款自研人工智能推理芯片Jalapeño的首批性能测试结果。这款芯片主要用于大型语言模型完成训练后的推理环节,也就是ChatGPT回答问题、API生成内容以及AI Agent执行任务时持续发生的计算。在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三个公开模型上,Jalapeño与英伟达GB200和GB300系统进行了直接比较。按照各款加速器公布的芯片额定功耗进行归一化计算,Jalapeño在峰值吞吐场景下每单位功耗完成的推理工作量约高1.5倍至1.9倍,端到端响应延迟则降低约1.7倍至3.6倍。
对于OpenAI而言,这组结果首先关系到一个越来越现实的成本问题。训练一个大型模型需要集中投入庞大的计算资源,但模型上线以后,每一次用户请求都会继续产生推理计算。ChatGPT用户越多,API调用越频繁,AI Agent一次任务持续的步骤越长,推理所消耗的芯片、电力和数据中心资源就越大。OpenAI因此选择自己设计一款主要服务于推理的专用芯片,希望在继续采购外部加速器的同时,让一部分规模巨大而且长期持续的计算任务运行在针对自身需求设计的硬件上。
与GB200、GB300直接比较,优势首先出现在单位功耗和延迟
此次测试采用SemiAnalysis建立的InferenceX公开推理测试框架。OpenAI没有只测试自己的模型,而是同时选择了GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T,覆盖1200亿参数到约1万亿参数的大型模型。SemiAnalysis人员进入OpenAI实验室,与OpenAI工程师一起查看了InferenceX实际运行过程。
在GPT-OSS 120B测试中,Jalapeño按照700瓦芯片额定功耗计算,峰值吞吐量达到每千瓦85,448个mixed token;英伟达GB200按照1200瓦额定功耗计算,为44,960个,前者约为后者的1.9倍。两套系统的端到端响应延迟分别约为1.03秒和1.80秒。
在DeepSeek R1 670B测试中,Jalapeño与英伟达GB300比较,峰值单位功耗吞吐量约高1.7倍,端到端延迟约为1.65秒,GB300约为5.99秒;在Kimi K2.5 1T测试中,Jalapeño峰值单位功耗吞吐量约高1.5倍,端到端延迟约为1.56秒,对照系统约为5.31秒。OpenAI汇总三个模型后给出的结果是,Jalapeño峰值AI工作量每瓦提高约1.5倍至1.9倍,同时实现约1.7倍至3.6倍更低的端到端延迟。
这里的“每瓦”需要放在测试方法中理解。OpenAI并不是测量完整Jalapeño机架和完整英伟达机架的实际总耗电后计算出这一比例,而是使用各款加速器公布的芯片封装额定功耗进行统一归一化:Jalapeño为700瓦,GB200为1200瓦,GB300为1400瓦。OpenAI同时表示,在这批测试负载中,Jalapeño持续实际功耗没有超过550瓦。
因此,这批数据首先说明的是芯片级推理效率和响应速度,而不是已经证明一座完整Jalapeño数据中心只需要英伟达系统一半左右的实际电力。真正的数据中心成本还要把服务器、网络、内存、散热以及芯片利用率等因素同时计算进去。
OpenAI造Jalapeño,核心目标是降低越来越庞大的推理成本
Jalapeño与GB200、GB300的差别不仅体现在功耗数字上,两类芯片的设计目标也不同。英伟达GPU需要支持训练、推理以及更多类型的高性能计算任务,具有很强的通用性;Jalapeño则从一开始就围绕大型语言模型推理设计。OpenAI把芯片、HBM高带宽内存、网络互联、软件和机架系统放在一起优化,希望减少模型运行过程中等待数据、搬运模型状态以及不同芯片之间通信产生的延迟。
这种专用设计与AI数据中心正在面对的电力约束直接相关。大型AI基础设施继续扩张时,限制因素已经不只是能够购买多少GPU,还包括数据中心能够获得多少电力、变电设施能够承载多少负荷以及散热系统能够处理多少热量。同一单位电力能够稳定生成多少token,因此越来越直接地影响AI服务的长期运行成本。
OpenAI硬件负责人Richard Ho表示,Jalapeño目前在两类推理场景同时取得较好结果:高吞吐场景可以用相同基础设施服务更多用户,低延迟场景则可以缩短用户等待时间。他同时指出,Jalapeño只针对推理,并不承担大型模型训练,而模型训练仍是英伟达GPU最重要的优势领域之一。
这也决定了OpenAI当前的芯片战略并不是把现有计算平台全部换成自研芯片。OpenAI官方明确表示,公司仍将继续广泛部署英伟达以及其他合作伙伴提供的加速器,用于训练和推理。Jalapeño增加的是一条专门针对OpenAI自身推理负载优化的计算路线。
SemiAnalysis现场核验测试,但完整Agent负载还没有结果
SemiAnalysis对Jalapeño的首批表现给予了较高评价,认为第一代自研ASIC通常很难立即进入行业领先水平,而Jalapeño已经能够在多个公开大型模型上与英伟达等主流加速器进行直接性能比较。Jalapeño运行的不只是OpenAI自己的模型,DeepSeek和Kimi等第三方模型同样取得了较高性能,这也说明其设计并没有局限在单一OpenAI模型上。
不过,SemiAnalysis同时列出了这批测试的重要边界。此次公布的所有数字由OpenAI提供,SemiAnalysis人员虽然在实验室现场确认了InferenceX测试运行,但并没有自行完成完整的InferenceX测试套件,也还没有看到Jalapeño的AgentX测试成绩。当前公开结果主要采用8k输入、1k输出的单轮测试,而AgentX包含更长上下文和多轮任务,更接近未来AI Agent持续运行时的数据中心负载。
长上下文和连续多轮任务会同时增加缓存、网络、路由和数据管理压力,因此现有测试中的低延迟和高吞吐优势能否完整延续到复杂Agent工作负载,还需要后续数据验证。这并不否定现有测试结果,而是决定这些结果能够在多大程度上代表未来真实生产环境。
与Blackwell的成绩已经公布,2027年真正面对的将是Rubin
Jalapeño首批测试主要以英伟达GB200和GB300作为对照,但两边的产品时间并不完全一致。GB200和GB300已经进入商业部署,而OpenAI目前主要拥有Jalapeño工程样片,公司计划到2026年底才开始在自己的计算基础设施中部署首批产品。
这意味着Jalapeño真正扩大规模时,英伟达的数据中心产品已经进入下一代Vera Rubin周期。SemiAnalysis因此认为,与Blackwell的比较能够反映Jalapeño目前的技术水平,但从产品代际看,与同样采用HBM4的新一代Rubin进行比较更加接近未来实际竞争环境。Vera Rubin系统已经开始向客户出货,而Jalapeño仍处于从工程样片向生产部署推进的阶段。
SemiAnalysis随后利用双方已经公开的数据进行了进一步比较。在其计算的系统级每兆瓦吞吐指标上,Jalapeño仍显示出较强表现;按照总拥有成本计算,Jalapeño和Vera Rubin每美元产生的输出token数量则已经较为接近。SemiAnalysis同时指出,两边目前采用的软件优化方式并不完全相同,因此这不是像此次GB200、GB300测试一样的同场实测,而是依据公开结果进行的跨平台分析。
这一时间差也使目前与英伟达的比较更加清晰:Jalapeño第一代产品已经在Blackwell一代推理测试中取得明显的单位功耗和延迟优势,但等到它真正进入较大规模生产,衡量标准也会随着英伟达下一代产品继续提高。
2026年底开始部署,规模化运行才是下一阶段考验
OpenAI计划在2026年底前开始将Jalapeño部署到自身计算基础设施。公司已经在开发第二代产品,第三代架构也已经开始形成。SemiAnalysis掌握的供应链信息显示,Jalapeño生产预计将在2027年逐步增加,主要产量集中在当年后期。
到了这一阶段,决定Jalapeño实际价值的指标将不再只是实验室中的benchmark。数千甚至更多芯片长期同时运行以后,芯片良率、HBM供应、服务器稳定性、网络可靠性、软件兼容性、散热和实际利用率都会进入成本计算,而这些因素最终决定每百万token需要多少基础设施投入。
OpenAI研发Jalapeño的目标由此变得十分明确:在继续使用英伟达等外部加速器承担大量训练和推理任务的同时,把不断扩大的内部推理负载逐步交给自己能够从模型、软件到芯片共同设计的计算系统。
8月25日公布的第一批结果已经证明,OpenAI首代自研推理芯片可以在GPT-OSS、DeepSeek R1和Kimi K2.5等大型模型上运行,并在与GB200、GB300的测试中取得较高的单位功耗吞吐量和较低延迟。接下来真正决定Jalapeño能否改变OpenAI计算成本结构的,将是2026年底开始的实际部署,以及2027年进入更大规模运行以后,这些实验室成绩能够保持多少。

读者评论
0 条评论