El chip Jalapeño de OpenAI demuestra ser más picante que el Blackwell de Nvidia en pruebas de rendimiento, pero esperaremos hasta 2027 para el calor completo
El chip personalizado de OpenAI supera al de Nvidia en pruebas de rendimiento, pero no se desplegará completamente hasta 2027 - así que contén tus caballos, o quizás solo tus tokens.
En la conferencia Hot Chips del martes, OpenAI finalmente destapó su chip de inferencia personalizado, Jalapeño, y - sorpresa, sorpresa - es bastante bueno en lo que hace. Probado con el benchmark InferenceX de SemiAnalysis, Jalapeño entregó más tokens por usuario y más rendimiento por kilovatio que los procesadores de inferencia de última generación actuales. Es una forma elegante de decir que sirve más IA por vatio, que es el tipo de eficiencia que hace que contadores y ecologistas hagan un pequeño baile de alegría.
"El resultado final es que los resultados muestran un avance de rendimiento muy, muy significativo sobre el estado del arte", dijo Richard Ho, jefe de hardware de OpenAI, en una llamada con la prensa. "Jalapeño puede servir más trabajo de IA por unidad de potencia, mientras también devuelve respuestas más rápidamente. Es muy eficiente para servir a muchos clientes, pero también puede tener muy baja latencia".
Pero antes de que empieces a planear un desfile, aquí está el detalle: esa comparación es contra un sistema Nvidia Blackwell - que, para cuando Jalapeño realmente llegue al mercado, podría tener algunos trucos más bajo la manga. Ho estimó que Jalapeño se desplegaría a finales de 2026 "en volúmenes muy pequeños", con un despliegue más significativo en 2027. Así que, tenemos un tiempo antes de probar el sabor completo.
Anunciado por primera vez en octubre pasado, Jalapeño fue desarrollado por OpenAI en estrecha colaboración con Broadcom, con los propios modelos de OpenAI asistiendo en el proceso de desarrollo. La compañía planea hacer de Jalapeño una plataforma multigeneracional, permitiendo que productos de IA, modelos, chips y memoria se desarrollen en conjunto. Debido a ese enfoque de pila completa, OpenAI pudo abordar fases específicas en el proceso de inferencia que a menudo causan fricción durante el procesamiento de inferencia. En particular, Jalapeño está diseñado para minimizar los retrasos durante las fases de prefill y comunicación del procesamiento, que OpenAI dice que a menudo actúan como cuellos de botella.
"Diseñamos Jalapeño para minimizar el movimiento de datos y los retrasos de comunicación", dijo la compañía en una publicación de blog presentando los resultados. "Esto significa que el estado del modelo, incluida la caché KV utilizada al generar una respuesta, puede colocarse explícitamente y mantenerse local mientras el sistema activa la combinación correcta de cómputo, memoria y redes para cada fase de inferencia". En otras palabras, han hecho que el chip sea inteligente sobre dónde pone las cosas, para que no tenga que correr buscándolas. Revolucionario, lo sabemos.
The Good Times
Noticias en tu bandeja.
Un resumen sardónico, entregado según tu horario. Gratis. Cancela cuando tu tolerancia al ingenio se agote.
¿Ya estás suscrito pero nunca llegamos a tu bandeja? Revisa la carpeta de spam y pulsa 'No es spam' (o 'Quitar de spam') para rescatarnos del purgatorio del correo basura. De paso ayudas a todos los demás.
Si no abres ninguno de nuestros correos durante un mes, se te eliminará automáticamente de la lista.
Rewrite Article
Select parts to regenerate with a fresh AI pass. Translations will be updated automatically.
Generate AI Image
Creates a sardonic version of the article image using OpenAI.