OpenAIs Jalapeño-chip bevisar sig hetare än Nvidias Blackwell i tester, men vi får vänta till 2027 för full hetta
OpenAIs anpassade chip slår Nvidias i tester, men det kommer inte att distribueras fullt ut förrän 2027 - så håll i hästarna, eller kanske bara dina tokens.
På Hot Chips-konferensen på tisdagen drog OpenAI äntligen undan ridån för sin anpassade inferenschip, Jalapeño, och - överraskning, överraskning - den är ganska bra på vad den gör. Testad på SemiAnalys InferenceX-riktmärke levererade Jalapeño fler tokens per användare och mer genomströmning per kilowatt än nuvarande toppmoderna inferensprocessorer. Det är ett fint sätt att säga att den serverar mer AI per watt, vilket är den typen av effektivitet som får både revisorer och miljöaktivister att göra en liten glädjedans.
"Slutsatsen är att resultaten visar en mycket, mycket betydande prestandaförbättring jämfört med toppmodern teknik," sade Richard Ho, OpenAIs hårdvaruchef, i ett presssamtal. "Jalapeño kan servera mer AI-arbete per energienhet, samtidigt som den svarar snabbare. Det är mycket effektivt att betjäna många kunder, men den kan också ha mycket låg latens."
Men innan du börjar planera en parad, här är haken: den jämförelsen är mot ett Nvidia Blackwell-system - som, när Jalapeño faktiskt kommer ut på marknaden, kan ha några fler knep i rockärmen. Ho uppskattade att Jalapeño skulle distribueras i slutet av 2026 "i mycket små volymer," med mer betydande distribution under 2027. Så det dröjer ett tag innan vi får smaka på den fulla smaken.
Först tillkännagavs i oktober förra året, utvecklades Jalapeño av OpenAI i nära samarbete med Broadcom, med OpenAIs egna modeller som hjälpte till i utvecklingsprocessen. Företaget planerar att göra Jalapeño till en multigenerationell plattform, vilket gör att AI-produkter, modeller, chip och minne alla utvecklas i samklang. På grund av denna helhetsstrategi kunde OpenAI ta itu med specifika faser i inferensprocessen som ofta orsakar friktion under inferensbearbetning. I synnerhet är Jalapeño utformad för att minimera fördröjningar under prefill- och kommunikationsfaserna av bearbetningen, som OpenAI säger ofta fungerar som flaskhalsar.
"Vi designade Jalapeño för att minimera dataförflyttning och kommunikationsfördröjningar," sade företaget i ett blogginlägg som presenterade resultaten. "Detta innebär att modelltillståndet, inklusive KV-cachen som används när ett svar genereras, kan placeras explicit och hållas lokalt medan systemet aktiverar rätt kombination av beräkning, minne och nätverk för varje inferensfas." Med andra ord har de gjort chippet smart om var det placerar saker, så att det inte behöver springa runt och leta efter dem. Revolutionerande, vi vet.
The Good Times
Nyheter i din inkorg.
En sardonisk sammanfattning, levererad enligt ditt schema. Gratis. Avsluta prenumerationen när du vill.
Redan prenumerant men vi dyker aldrig upp? Kolla skräppostmappen och klicka på 'Inte skräppost' (eller 'Ta bort från skräppost') för att rädda oss ur skräppostens skärseld. På köpet hjälper du alla andra.
Om du inte öppnar något av våra mejl på en månad tas du automatiskt bort från listan.
Rewrite Article
Select parts to regenerate with a fresh AI pass. Translations will be updated automatically.
Generate AI Image
Creates a sardonic version of the article image using OpenAI.