O Chip Jalapeño da OpenAI Prova Ser Mais Picante que o Blackwell da Nvidia em Benchmarks, Mas Vamos Esperar até 2027 para o Calor Total
O chip personalizado da OpenAI supera o da Nvidia em benchmarks, mas não será totalmente implantado até 2027 - então segure seus cavalos, ou talvez apenas seus tokens.
Na conferência Hot Chips na terça-feira, a OpenAI finalmente tirou a cortina do seu chip de inferência personalizado, Jalapeño, e - surpresa, surpresa - ele é muito bom no que faz. Testado no benchmark InferenceX da SemiAnalysis, o Jalapeño entregou mais tokens por usuário e mais throughput por quilowatt do que os processadores de inferência de última geração atuais. Isso é uma maneira elegante de dizer que ele serve mais IA por watt, o que é o tipo de eficiência que faz contadores e ambientalistas dançarem uma dança feliz.
"O resultado final é que os resultados mostram um avanço de desempenho muito, muito significativo sobre o estado da arte," disse Richard Ho, chefe de hardware da OpenAI, em uma chamada de imprensa. "O Jalapeño pode servir mais trabalho de IA por unidade de energia, enquanto também retorna respostas mais rapidamente. É muito eficiente para atender muitos clientes, mas também pode ter latência muito baixa."
Mas antes de começar a planejar um desfile, aqui está o detalhe: essa comparação é contra um sistema Nvidia Blackwell - que, quando o Jalapeño realmente chegar ao mercado, pode ter alguns truques na manga. Ho estimou que o Jalapeño seria implantado no final de 2026 "em volumes muito pequenos," com implantação mais significativa em 2027. Então, temos um tempo antes de provarmos o sabor completo.
Anunciado pela primeira vez em outubro passado, o Jalapeño foi desenvolvido pela OpenAI em estreita colaboração com a Broadcom, com os próprios modelos da OpenAI auxiliando no processo de desenvolvimento. A empresa planeja tornar o Jalapeño uma plataforma multigeracional, permitindo que produtos de IA, modelos, chips e memória sejam desenvolvidos em conjunto. Por causa dessa abordagem de pilha completa, a OpenAI foi capaz de abordar fases específicas no processo de inferência que frequentemente causam atrito durante o processamento de inferência. Em particular, o Jalapeño é projetado para minimizar atrasos durante as fases de prefill e comunicação do processamento, que a OpenAI diz que muitas vezes agem como gargalos.
"Projetamos o Jalapeño para minimizar o movimento de dados e atrasos de comunicação," disse a empresa em um post de blog apresentando os resultados. "Isso significa que o estado do modelo, incluindo o cache KV usado ao gerar uma resposta, pode ser explicitamente colocado e mantido local enquanto o sistema ativa a combinação certa de computação, memória e rede para cada fase de inferência." Em outras palavras, eles tornaram o chip inteligente sobre onde coloca as coisas, para que ele não precise correr procurando por elas. Revolucionário, sabemos.
The Good Times
Notícias na sua caixa.
Um resumo sardônico, entregue conforme sua agenda. Grátis. Cancele quando quiser.
Já está inscrito mas nunca chegamos à sua caixa de entrada? Veja a pasta de spam e clique em 'Não é spam' (ou 'Remover do spam') para nos tirar do purgatório do lixo eletrônico. De quebra, ajuda todo mundo.
Se você não abrir nenhum dos nossos e-mails por um mês, será removido automaticamente da lista.
Rewrite Article
Select parts to regenerate with a fresh AI pass. Translations will be updated automatically.
Generate AI Image
Creates a sardonic version of the article image using OpenAI.