Na conferência Hot Chips na terça-feira, a OpenAI finalmente tirou a cortina do seu chip de inferência personalizado, Jalapeño, e - surpresa, surpresa - ele é muito bom no que faz. Testado no benchmark InferenceX da SemiAnalysis, o Jalapeño entregou mais tokens por usuário e mais throughput por quilowatt do que os processadores de inferência de última geração atuais. Isso é uma maneira elegante de dizer que ele serve mais IA por watt, o que é o tipo de eficiência que faz contadores e ambientalistas dançarem uma dança feliz.

"O resultado final é que os resultados mostram um avanço de desempenho muito, muito significativo sobre o estado da arte," disse Richard Ho, chefe de hardware da OpenAI, em uma chamada de imprensa. "O Jalapeño pode servir mais trabalho de IA por unidade de energia, enquanto também retorna respostas mais rapidamente. É muito eficiente para atender muitos clientes, mas também pode ter latência muito baixa."

Mas antes de começar a planejar um desfile, aqui está o detalhe: essa comparação é contra um sistema Nvidia Blackwell - que, quando o Jalapeño realmente chegar ao mercado, pode ter alguns truques na manga. Ho estimou que o Jalapeño seria implantado no final de 2026 "em volumes muito pequenos," com implantação mais significativa em 2027. Então, temos um tempo antes de provarmos o sabor completo.

Anunciado pela primeira vez em outubro passado, o Jalapeño foi desenvolvido pela OpenAI em estreita colaboração com a Broadcom, com os próprios modelos da OpenAI auxiliando no processo de desenvolvimento. A empresa planeja tornar o Jalapeño uma plataforma multigeracional, permitindo que produtos de IA, modelos, chips e memória sejam desenvolvidos em conjunto. Por causa dessa abordagem de pilha completa, a OpenAI foi capaz de abordar fases específicas no processo de inferência que frequentemente causam atrito durante o processamento de inferência. Em particular, o Jalapeño é projetado para minimizar atrasos durante as fases de prefill e comunicação do processamento, que a OpenAI diz que muitas vezes agem como gargalos.

"Projetamos o Jalapeño para minimizar o movimento de dados e atrasos de comunicação," disse a empresa em um post de blog apresentando os resultados. "Isso significa que o estado do modelo, incluindo o cache KV usado ao gerar uma resposta, pode ser explicitamente colocado e mantido local enquanto o sistema ativa a combinação certa de computação, memória e rede para cada fase de inferência." Em outras palavras, eles tornaram o chip inteligente sobre onde coloca as coisas, para que ele não precise correr procurando por elas. Revolucionário, sabemos.