Cipul Jalapeño de la OpenAI se dovedește mai iute decât Blackwell de la Nvidia în benchmark-uri, dar așteptăm până în 2027 pentru tot focul
Cipul personalizat al OpenAI depășește Nvidia în benchmark-uri, dar nu va fi implementat complet până în 2027 - așa că țineți-vă caii, sau poate doar token-urile.
La conferința Hot Chips de marți, OpenAI a tras în sfârșit cortina de pe cipul său personalizat de inferență, Jalapeño, și - surpriză, surpriză - este destul de bun la ceea ce face. Testat pe benchmark-ul InferenceX de la SemiAnalysis, Jalapeño a livrat mai multe token-uri per utilizator și mai mult debit per kilowatt decât procesoarele de inferență de ultimă generație. Asta e un mod elegant de a spune că servește mai mult AI per watt, ceea ce este genul de eficiență care îi face atât pe contabili, cât și pe ecologiști să facă un mic dans de bucurie.
„Concluzia este că rezultatele arată un avans de performanță foarte, foarte semnificativ față de stadiul actual al tehnologiei”, a declarat Richard Ho, șeful hardware-ului OpenAI, într-un apel de presă. „Jalapeño poate servi mai multă muncă AI per unitate de putere, returnând în același timp răspunsuri mai rapid. Este foarte eficient pentru a servi mulți clienți, dar poate avea și o latență foarte scăzută.”
Dar înainte să începeți să planificați o paradă, iată partea amuzantă: acea comparație este împotriva unui sistem Nvidia Blackwell - care, până când Jalapeño va ajunge efectiv pe piață, s-ar putea să aibă câteva trucuri în plus în mânecă. Ho a estimat că Jalapeño va fi implementat la sfârșitul anului 2026 „în volume foarte mici”, cu o implementare mai semnificativă în 2027. Deci, mai avem ceva timp până să gustăm din plin aroma.
Anunțat pentru prima dată în octombrie anul trecut, Jalapeño a fost dezvoltat de OpenAI în strânsă colaborare cu Broadcom, cu propriile modele OpenAI asistând în procesul de dezvoltare. Compania intenționează să facă din Jalapeño o platformă multigenerațională, permițând ca produsele AI, modelele, cipurile și memoria să fie dezvoltate în concert. Datorită acestei abordări full-stack, OpenAI a reușit să abordeze faze specifice din procesul de inferență care adesea cauzează fricțiuni în timpul procesării. În special, Jalapeño este proiectat să minimizeze întârzierile în fazele de prefill și comunicare ale procesării, pe care OpenAI spune că acționează adesea ca blocaje.
„Am proiectat Jalapeño pentru a minimiza mișcarea datelor și întârzierile de comunicare”, a declarat compania într-o postare pe blog care prezintă rezultatele. „Aceasta înseamnă că starea modelului, inclusiv cache-ul KV folosit în timpul generării unui răspuns, poate fi plasată explicit și păstrată local în timp ce sistemul activează combinația potrivită de calcul, memorie și rețea pentru fiecare fază de inferență.” Cu alte cuvinte, au făcut cipul inteligent în privința locului unde pune lucrurile, astfel încât să nu fie nevoit să alerge după ele. Revoluționar, știm.
The Good Times
Știri în inbox-ul tău.
Un rezumat sardonic, livrat după programul tău. Gratuit. Dezabonează-te oricând.
Ești deja abonat dar nu ajungem niciodată în inbox? Verifică folderul de spam și apasă 'Nu este spam' (sau 'Elimină din spam') ca să ne scoți din purgatoriul mesajelor nedorite. Îi ajuți și pe ceilalți.
Dacă nu deschizi niciunul dintre e-mailurile noastre timp de o lună, vei fi eliminat automat din listă.
Rewrite Article
Select parts to regenerate with a fresh AI pass. Translations will be updated automatically.
Generate AI Image
Creates a sardonic version of the article image using OpenAI.