在周二的Hot Chips大会上,OpenAI终于揭开了其定制推理芯片Jalapeño的神秘面纱——而且,惊喜惊喜——它确实很擅长做这件事。在SemiAnalysis的InferenceX基准测试中,Jalapeño每用户生成的token数和每千瓦的吞吐量都超过了当前最先进的推理处理器。这用花哨的话说就是,它每瓦特能提供更多AI服务,这种效率让会计和环保人士都高兴得跳起舞来。

“底线是,结果显示性能比现有技术有非常非常显著的提升,”OpenAI硬件主管Richard Ho在新闻发布会上说。“Jalapeño每单位功率能处理更多AI工作,同时响应速度也更快。它非常适合服务大量客户,但也能实现极低延迟。”

但先别急着庆祝,关键来了:这个比较是针对Nvidia Blackwell系统的——而到Jalapeño真正上市时,Blackwell可能还有更多花招。Ho估计Jalapeño将在2026年底“以非常小的量”部署,更重要的部署要到2027年。所以,我们还得等上一阵子才能尝到全味。

Jalapeño于去年10月首次公布,由OpenAI与博通紧密合作开发,OpenAI自己的模型也参与了开发过程。公司计划将Jalapeño打造成一个多代平台,让AI产品、模型、芯片和内存协同发展。由于这种全栈方法,OpenAI能够解决推理过程中经常造成瓶颈的特定阶段。特别是,Jalapeño旨在最小化处理过程中的预填充和通信阶段的延迟,OpenAI称这些阶段往往是瓶颈。

“我们设计Jalapeño是为了最小化数据移动和通信延迟,”公司在展示结果的博客文章中说。“这意味着模型状态,包括生成响应时使用的KV缓存,可以被明确放置并保持本地化,而系统则为每个推理阶段激活正确的计算、内存和网络组合。”换句话说,他们让芯片在放置东西时变得聪明,这样它就不必到处寻找了。革命性的,我们知道。