À la conférence Hot Chips mardi, OpenAI a enfin levé le voile sur sa puce d'inférence sur mesure, Jalapeño, et - surprise, surprise - elle est plutôt bonne dans ce qu'elle fait. Testée sur le benchmark InferenceX de SemiAnalysis, Jalapeño a fourni plus de tokens par utilisateur et plus de débit par kilowatt que les processeurs d'inférence de pointe actuels. C'est une façon élégante de dire qu'elle sert plus d'IA par watt, ce qui est le genre d'efficacité qui fait faire une petite danse de joie aux comptables et aux écologistes.

« En fin de compte, les résultats montrent une avancée de performance très, très significative par rapport à l'état de l'art », a déclaré Richard Ho, responsable du matériel chez OpenAI, lors d'une conférence de presse. « Jalapeño peut servir plus de travail d'IA par unité de puissance, tout en renvoyant des réponses plus rapidement. C'est très efficace pour servir beaucoup de clients, mais cela peut aussi être très faible latence. »

Mais avant de commencer à planifier une parade, voici le hic : cette comparaison se fait avec un système Nvidia Blackwell - qui, d'ici à ce que Jalapeño arrive réellement sur le marché, pourrait avoir quelques tours de plus dans son sac. Ho a estimé que Jalapeño serait déployé fin 2026 « en très petits volumes », avec un déploiement plus significatif en 2027. Donc, on a du temps avant de goûter à la pleine saveur.

Annoncée pour la première fois en octobre dernier, Jalapeño a été développée par OpenAI en étroite collaboration avec Broadcom, avec les propres modèles d'OpenAI assistant au processus de développement. L'entreprise prévoit de faire de Jalapeño une plateforme multigénérationnelle, permettant aux produits d'IA, modèles, puces et mémoire d'être développés en concert. Grâce à cette approche de pile complète, OpenAI a pu traiter des phases spécifiques du processus d'inférence qui causent souvent des frictions pendant le traitement. En particulier, Jalapeño est conçue pour minimiser les délais pendant les phases de préremplissage et de communication du traitement, qu'OpenAI dit être souvent des goulots d'étranglement.

« Nous avons conçu Jalapeño pour minimiser le mouvement des données et les délais de communication », a déclaré l'entreprise dans un article de blog présentant les résultats. « Cela signifie que l'état du modèle, y compris le cache KV utilisé lors de la génération d'une réponse, peut être explicitement placé et conservé localement pendant que le système active la bonne combinaison de calcul, de mémoire et de réseau pour chaque phase d'inférence. » En d'autres termes, ils ont rendu la puce intelligente quant à l'endroit où elle place les choses, afin qu'elle n'ait pas à courir après. Révolutionnaire, nous savons.