Op de Hot Chips-conferentie dinsdag haalde OpenAI eindelijk het doek van zijn aangepaste inferentiechip, Jalapeño, en - verrassing, verrassing - hij is behoorlijk goed in wat hij doet. Getest op SemiAnalysis' InferenceX-benchmark leverde Jalapeño meer tokens per gebruiker en meer doorvoer per kilowatt op dan de huidige state-of-the-art inferentieprocessors. Dat is een chique manier om te zeggen dat het meer AI per watt serveert, het soort efficiëntie waar zowel accountants als milieuactivisten een klein vreugdedansje van doen.

“De bottom line is dat de resultaten een zeer, zeer significante prestatieverbetering ten opzichte van de state of the art laten zien,” zei Richard Ho, hoofd hardware bij OpenAI, in een persgesprek. “Jalapeño kan meer AI-werk per eenheid vermogen serveren, terwijl het ook sneller antwoorden retourneert. Het is zeer efficiënt om veel klanten te bedienen, maar het kan ook zeer lage latentie hebben.”

Maar voordat je een parade gaat plannen, hier is de kicker: die vergelijking is tegen een Nvidia Blackwell-systeem - dat, tegen de tijd dat Jalapeño daadwerkelijk op de markt komt, misschien een paar extra trucjes in petto heeft. Ho schatte dat Jalapeño eind 2026 “in zeer kleine volumes” zou worden uitgerold, met een significantere uitrol in 2027. Dus we hebben nog even voordat we de volledige smaak proeven.

Voor het eerst aangekondigd in oktober vorig jaar, is Jalapeño ontwikkeld door OpenAI in nauwe samenwerking met Broadcom, waarbij OpenAI's eigen modellen hielpen bij het ontwikkelingsproces. Het bedrijf is van plan om Jalapeño een multigenerationeel platform te maken, waardoor AI-producten, modellen, chips en geheugen allemaal in samenhang kunnen worden ontwikkeld. Door die full-stack aanpak kon OpenAI specifieke fasen in het inferentieproces aanpakken die vaak wrijving veroorzaken tijdens inferentieverwerking. In het bijzonder is Jalapeño ontworpen om vertragingen tijdens de prefill- en communicatiefasen van de verwerking te minimaliseren, waarvan OpenAI zegt dat deze vaak knelpunten vormen.

“We hebben Jalapeño ontworpen om databeweging en communicatievertragingen te minimaliseren,” zei het bedrijf in een blogpost waarin de resultaten werden gepresenteerd. “Dit betekent dat de modelstatus, inclusief de KV-cache die wordt gebruikt tijdens het genereren van een antwoord, expliciet kan worden geplaatst en lokaal kan worden gehouden terwijl het systeem de juiste combinatie van rekenkracht, geheugen en netwerken activeert voor elke inferentiefase.” Met andere woorden, ze hebben de chip slim gemaakt over waar hij dingen plaatst, zodat hij niet rond hoeft te rennen om ze te zoeken. Revolutionair, we weten het.