La carrera por una inferencia de IA más rápida está en marcha, y los mercados dieron una cálida bienvenida a Cerebras y sus chips especializados en su debut en bolsa en mayo. Pero la startup francesa Kog apuesta a que hay mucho más poder que exprimir de las GPU convencionales.
La startup llegó a la portada de Hacker News en mayo con una vista previa técnica destinada a demostrar que "la decodificación de solicitudes individuales extremadamente rápida es posible en las GPU de centro de datos estándar que las empresas ya poseen" - como las AMD MI300X y NVIDIA H200 que usó para su demostración.
Algunos se decepcionaron al saber que esto no se extendía a las GPU de nuestros portátiles, pero otros vieron el potencial. Con la velocidad y los costos de inferencia siendo ahora un cuello de botella crítico, la promesa de Kog de desbloquear nuevas capacidades en hardware existente con optimización de software atrajo a más que simples curiosos. "Tuvimos 200 contactos comerciales tangibles", dijo el CEO Gaël Delalleau a TechCrunch.
Basándose en los primeros comentarios, el fundador en solitario espera que la ingeniería de software sea el primer caso de uso. Los veteranos usuarios de Claude Code saben bien que a veces tienen que esperar horas para obtener resultados. La propia Anthropic entiende que la velocidad vale dinero, y cobra un múltiplo de precio por el Modo Rápido de Claude.
Kog espera apuntar a clientes que se sienten desanimados por esos retrasos, generalmente porque dependen de flujos de trabajo de IA para tareas profesionales. Pero la startup también tiene socios de diseño que permiten a los usuarios generar juegos y aplicaciones con un prompt, y para quienes un resultado más rápido gracias al Motor de Inferencia Kog (KIE) significaría más ingresos, dijo Delalleau.
La empresa se da cuenta de que este mercado aún no está maduro. Mientras observaba la demanda, Kog aprendió que sus posibles clientes no están preparados para ajustar modelos pequeños. "Y es por eso que desde el lanzamiento, nos hemos centrado por completo en acelerar el desarrollo de modelos más grandes para satisfacer la demanda que hemos visto".
Esto deja a Kog con un gran salto que dar para cumplir su promesa de "inferencia de LLM 30 veces más rápida". Su demostración mostró unos impresionantes 3,000 tokens por segundo (TPS) por solicitud - pero con un modelo pequeño hecho a medida de solo unos 2 mil millones de parámetros, el ahora de código abierto Laneformer 2B.
Contradiciendo a los escépticos, Delalleau confía en que el mismo enfoque puede funcionar igual de bien con LLMs, cuyo tamaño puede ser un desafío para los chips de inferencia. "Las GPU tienen un futuro brillante", dijo. Para el CEO de Kog, la idea de que no son adecuadas para la decodificación se ha convertido en un concepto erróneo; las GPU más nuevas tienen cada vez más ancho de banda de memoria que solo pide ser desbloqueado.
Kog no está solo en pensar que la optimización de software puede ayudar a las GPU a hacer más de lo que dice la caja. ZML, también de Francia, lanzó un software independiente del hardware que evita el CUDA de Nvidia para soportar inferencia rápida en chips competidores. Pero Delalleau dijo que Kog se parece más al laboratorio Hazy Research de la Universidad de Stanford, con un enfoque aún más profundo en la aceleración de GPU.
Delalleau no es investigador, y su primera startup, Stribe, alumna de TechCrunch50 2009, no tiene nada que ver con la nueva - aparte de su ex cofundador convertido en VC Kamel Zeroual, cuya firma Varsity VC co-lideró la ronda semilla de Kog. Pero el enfoque profundo de la startup proviene de su trasfondo único.
Habiendo estudiado física del estado sólido en la École Polytechnique de Francia, pasó a trabajar en ciberseguridad ofensiva - también conocida como hacking de sombrero blanco. Según Delalleau, esto moldeó la mentalidad que ahora anima a su equipo a adoptar. En el lado científico, "hay esta mentalidad de entender las leyes de la física, y las leyes de la GPU para aprovecharlas al máximo".
En cuanto al hacking, el cuatro veces finalista del torneo CTF de DEF CON dijo que le enseñó "a hacer ingeniería inversa a un nivel muy bajo - hasta el lenguaje ensamblador y el código binario - para entender cómo funciona, y tratar de usarlo para lograr un objetivo para el que no fue necesariamente diseñado".
La desventaja de este enfoque es que es muy práctico y requiere mucho tiempo. "Para cada nueva GPU, dedicaremos varias semanas o incluso meses, para profundizar en los detalles y"