På Hot Chips-konferensen på tisdagen drog OpenAI äntligen undan ridån för sin anpassade inferenschip, Jalapeño, och - överraskning, överraskning - den är ganska bra på vad den gör. Testad på SemiAnalys InferenceX-riktmärke levererade Jalapeño fler tokens per användare och mer genomströmning per kilowatt än nuvarande toppmoderna inferensprocessorer. Det är ett fint sätt att säga att den serverar mer AI per watt, vilket är den typen av effektivitet som får både revisorer och miljöaktivister att göra en liten glädjedans.

"Slutsatsen är att resultaten visar en mycket, mycket betydande prestandaförbättring jämfört med toppmodern teknik," sade Richard Ho, OpenAIs hårdvaruchef, i ett presssamtal. "Jalapeño kan servera mer AI-arbete per energienhet, samtidigt som den svarar snabbare. Det är mycket effektivt att betjäna många kunder, men den kan också ha mycket låg latens."

Men innan du börjar planera en parad, här är haken: den jämförelsen är mot ett Nvidia Blackwell-system - som, när Jalapeño faktiskt kommer ut på marknaden, kan ha några fler knep i rockärmen. Ho uppskattade att Jalapeño skulle distribueras i slutet av 2026 "i mycket små volymer," med mer betydande distribution under 2027. Så det dröjer ett tag innan vi får smaka på den fulla smaken.

Först tillkännagavs i oktober förra året, utvecklades Jalapeño av OpenAI i nära samarbete med Broadcom, med OpenAIs egna modeller som hjälpte till i utvecklingsprocessen. Företaget planerar att göra Jalapeño till en multigenerationell plattform, vilket gör att AI-produkter, modeller, chip och minne alla utvecklas i samklang. På grund av denna helhetsstrategi kunde OpenAI ta itu med specifika faser i inferensprocessen som ofta orsakar friktion under inferensbearbetning. I synnerhet är Jalapeño utformad för att minimera fördröjningar under prefill- och kommunikationsfaserna av bearbetningen, som OpenAI säger ofta fungerar som flaskhalsar.

"Vi designade Jalapeño för att minimera dataförflyttning och kommunikationsfördröjningar," sade företaget i ett blogginlägg som presenterade resultaten. "Detta innebär att modelltillståndet, inklusive KV-cachen som används när ett svar genereras, kan placeras explicit och hållas lokalt medan systemet aktiverar rätt kombination av beräkning, minne och nätverk för varje inferensfas." Med andra ord har de gjort chippet smart om var det placerar saker, så att det inte behöver springa runt och leta efter dem. Revolutionerande, vi vet.