Il chip Jalapeño di OpenAI si dimostra più piccante del Blackwell di Nvidia nei benchmark, ma aspetteremo il 2027 per il pieno calore
Il chip personalizzato di OpenAI supera quello di Nvidia nei benchmark, ma non sarà completamente distribuito fino al 2027 - quindi tenete i cavalli, o forse solo i token.
Alla conferenza Hot Chips di martedì, OpenAI ha finalmente tolto il velo sul suo chip di inferenza personalizzato, Jalapeño, e - sorpresa, sorpresa - è piuttosto bravo in quello che fa. Testato sul benchmark InferenceX di SemiAnalysis, Jalapeño ha fornito più token per utente e più throughput per kilowatt rispetto agli attuali processori di inferenza all'avanguardia. Questo è un modo elegante per dire che serve più IA per watt, il tipo di efficienza che fa fare un piccolo ballo di gioia sia ai contabili che agli ambientalisti.
"Il punto è che i risultati mostrano un avanzamento delle prestazioni molto, molto significativo rispetto allo stato dell'arte", ha detto Richard Ho, responsabile dell'hardware di OpenAI, in una conferenza stampa. "Jalapeño può servire più lavoro di IA per unità di potenza, rispondendo anche più rapidamente. È molto efficiente per servire molti clienti, ma può anche avere una latenza molto bassa."
Ma prima che iniziate a pianificare una parata, ecco la fregatura: il confronto è con un sistema Nvidia Blackwell - che, quando Jalapeño arriverà effettivamente sul mercato, potrebbe avere qualche asso nella manica in più. Ho ha stimato che Jalapeño verrà distribuito alla fine del 2026 "in volumi molto ridotti", con una distribuzione più significativa nel 2027. Quindi, dovremo aspettare un po' prima di assaggiare il sapore pieno.
Annunciato per la prima volta lo scorso ottobre, Jalapeño è stato sviluppato da OpenAI in stretta collaborazione con Broadcom, con i modelli di OpenAI che hanno assistito nel processo di sviluppo. L'azienda prevede di rendere Jalapeño una piattaforma multigenerazionale, consentendo lo sviluppo congiunto di prodotti IA, modelli, chip e memoria. Grazie a questo approccio full-stack, OpenAI è stata in grado di affrontare fasi specifiche del processo di inferenza che spesso causano attriti durante l'elaborazione. In particolare, Jalapeño è progettato per ridurre al minimo i ritardi durante le fasi di prefill e comunicazione del processo, che OpenAI afferma essere spesso colli di bottiglia.
"Abbiamo progettato Jalapeño per ridurre al minimo il movimento dei dati e i ritardi di comunicazione", ha dichiarato l'azienda in un post sul blog che presentava i risultati. "Ciò significa che lo stato del modello, inclusa la cache KV utilizzata durante la generazione di una risposta, può essere esplicitamente posizionato e mantenuto localmente mentre il sistema attiva la giusta combinazione di calcolo, memoria e rete per ogni fase di inferenza." In altre parole, hanno reso il chip intelligente su dove mette le cose, così non deve correre in giro a cercarle. Rivoluzionario, lo sappiamo.
The Good Times
Notizie nella tua casella.
Un riepilogo sardonico, consegnato secondo il tuo programma. Gratis. Annulla quando vuoi.
Già iscritto ma non arriviamo mai nella tua casella? Controlla la cartella spam e premi 'Non è spam' (o 'Rimuovi dallo spam') per tirarci fuori dal purgatorio della posta indesiderata. Aiuterai anche tutti gli altri.
Se non apri nessuna delle nostre email per un mese, verrai rimosso automaticamente dalla lista.
Rewrite Article
Select parts to regenerate with a fresh AI pass. Translations will be updated automatically.
Generate AI Image
Creates a sardonic version of the article image using OpenAI.