À l'été 2017, des chercheurs de Google ont publié un article intitulé « Attention Is All You Need », introduisant le transformateur – un réseau de neurones qui s'est avéré spectaculairement bon pour mâcher de longues séquences de texte. Neuf ans plus tard, les transformateurs sont le moteur de chaque grand modèle de langage (LLM). « Toute l'industrie de l'IA repose sur les transformateurs », déclare Justin Dangel, PDG de la startup d'IA Subquadratic, les qualifiant de l'une des innovations les plus importantes de l'histoire de l'informatique. Mais même les plus grands succès commencent à fatiguer avec le temps.

Les transformateurs montrent leur âge. Les récentes avancées des LLM – comme les modèles de raisonnement qui griffonnent des notes pour eux-mêmes et gèrent des entrées massives – ne sont pas des extensions propres de la technologie de base ; ce sont des rustines sur des défauts fondamentaux. Ainsi, un nombre croissant de scientifiques et d'ingénieurs se demandent : quelle est la suite ? Les LLM ne vont nulle part, mais la façon dont ils sont construits est à prendre. MIT Technology Review a surnommé cette future génération « LLM+ », et une vague de startups se précipite, espérant repousser les limites de cette technologie en plein essor. Certaines échoueront, mais elles ont tout à gagner et bien moins à perdre que les leaders actuels.

D'abord, le problème. Les transformateurs reposent sur l'attention dense, qui compare chaque mot (ou jeton) avec chaque autre mot par multiplication. Cela capture le sens brillamment, mais le calcul évolue horriblement : un document de 10 000 mots pourrait nécessiter 50 millions de multiplications. C'est pourquoi les LLM consomment autant d'énergie. Le président d'OpenAI, Greg Brockman, déclare que l'entreprise dépensera 50 milliards de dollars en calcul cette année, et l'Agence internationale de l'énergie prédit que la consommation d'électricité des centres de données doublera d'ici 2030. Les transformateurs ont également du mal avec les grandes fenêtres de contexte – suivre une bibliothèque, une base de code ou les sorties d'agents – et les modèles de raisonnement ajoutent plus de données à jongler. À mesure que les LLM grandissent, les transformateurs deviennent un goulot d'étranglement.

Voici quatre idées folles pour y remédier.

**Idée 1 : Attention éparse, style Subquadratic**

Subquadratic, basée à Miami, prétend avoir craqué l'attention éparse – ne calculer que certaines paires de mots au lieu de toutes – sans perdre le sens. Son modèle, SubQ, rivaliserait avec les meilleurs LLM sur les tâches de recherche et de codage. Les sceptiques restent, mais des milliers de personnes ont rejoint la liste d'attente. L'entreprise dit qu'elle détermine à la volée quels mots comptent, et prévoit une large diffusion bientôt.

**Idée 2 : Rétention de puissance de Manifest AI**

Manifest AI, à San Francisco, abandonne l'attention pour la « rétention de puissance », qui stocke uniquement les informations les plus pertinentes et fournit un résumé continu de la fenêtre de contexte, en laissant tomber les éléments moins pertinents à mesure que de nouvelles données arrivent. Le concept a une décennie, mais Manifest prétend qu'il est enfin compétitif avec les transformateurs. Il a transformé le LLM de codage open source StarCoder en PowerCoder et a publié Brumby, qui rivaliserait avec Qwen d'Alibaba. Le cofondateur Carles Gelada voit des applications allant de l'analyse de vidéos de plusieurs heures à des agents qui restent sur la tâche pendant des semaines.

**Idée 3 : Réseaux neuronaux liquides de Liquid AI**

Liquid AI, issue du MIT, associe les transformateurs à des réseaux neuronaux liquides – inspirés des vers – pour créer des « modèles de fondation liquides » (LFM). Ils sont beaucoup plus petits et plus économes en énergie, fonctionnant sur un Raspberry Pi à 50 $. Ils sont gratuits pour les organisations dont le chiffre d'affaires annuel est inférieur à 10 millions de dollars, et ont accumulé près de 34 millions de téléchargements, selon le PDG Ramin Hasani. Les modèles égalent des rivaux quatre fois plus grands, y compris des versions de Qwen et de Gemma de Google. La sauce secrète : une IA qui conçoit les modèles, aboutissant à un hybride de 20 % de transformateurs et 80 % de réseaux liquides. Hasani s'émerveille que le cerveau fonctionne avec 20 watts : « Nous pouvons être beaucoup plus innovants. »

**Idée 4 : Diffusion d'Inception**

Inception, basée à Palo Alto, génère des phrases entières en une fois en utilisant la diffusion – la technologie derrière les modèles d'images et de vidéos. Les LLM à diffusion, comme Mercury 2, prétendent égaler les performances de GPT-4 mais 10 fois plus vite. Le cofondateur Stefano Ermon, chercheur à Stanford, a trouvé les mathématiques pour faire fonctionner la diffusion avec du texte en