La startup d'infrastructure IA Infinity a levé 15 millions de dollars pour une valorisation de 100 millions, avec le soutien de Touring Capital, Principal VC, et des chercheurs d'OpenAI et Anthropic. L'entreprise a pour mission de rendre l'emprise de Nvidia sur le marché des puces IA un peu moins étouffante en développant un logiciel qui permet aux modèles d'IA de fonctionner sur n'importe quelle puce, pas seulement celles de Nvidia.

La domination de Nvidia ne tient pas seulement à ses puissants GPU ; elle repose aussi sur CUDA, la couche logicielle qui transforme les processeurs graphiques en bêtes de somme informatiques généralistes. Les principaux frameworks d'IA comme PyTorch et TensorFlow sont construits sur CUDA, ce qui signifie que les applications écrites en Python utilisent par défaut les puces Nvidia. La plupart des startups n'ont pas les ressources nécessaires pour écrire leur propre logiciel de noyau de bas niveau afin de porter les applications sur d'autres puces. Infinity vise à être l'alternative à CUDA, en créant une bibliothèque d'inférence universelle qui fonctionne sur SRAM, GPU, puces de téléphone et réseaux systoliques. Elle fait partie d'une vague de startups qui grignotent la part de marché de Nvidia, un produit à la fois.

Fondée l'année dernière par Jeremy Nixon, ancien chercheur chez Google Brain et créateur du réseau de hackers AGI House, Infinity est née de l'obsession de Nixon pour « l'invention automatisée ». Il a précédemment inventé un algorithme d'apprentissage automatique appelé Omega, qui générait et évaluait automatiquement de nouveaux algorithmes dans une boucle de rétroaction. Ce succès l'a conduit au matériel, où il pensait que des systèmes automatisés pouvaient générer le code de bas niveau nécessaire pour faire fonctionner les puces plus efficacement.

L'agent de recherche IA d'Infinity, Ignition, écrit du code de bas niveau pour l'inférence IA sur des puces non-Nvidia. Il teste, débogue, mesure les performances et réécrit le code si nécessaire, apprenant et s'adaptant en continu aux différentes architectures de puces. Le résultat, selon Nixon, est une pile logicielle de niveau CUDA. Les clients incluent D-Matrix, un fabricant de puces IA et challenger de Nvidia, et Infinity est en pourparlers avec d'autres grandes entreprises de puces et de cloud.

Les humains fournissent toujours une orientation de haut niveau, mais Ignition s'occupe du travail de fond. Dans une étude de cas, l'agent a réduit ce qui aurait pu être un processus de plusieurs années à quelques heures ou jours. Infinity ne facture pas de frais de licence initiaux ; elle prélève plutôt une part des gains de performance et des économies de coûts, mesurés en tokens par seconde. L'entreprise compte actuellement 26 employés répartis entre la conception, les opérations et l'ingénierie.