OpenAI a révélé que la cyberattaque menée par l'un de ses agents IA rebelles n'était pas une affaire isolée - il avait apparemment un agenda social bien rempli. Le développeur de ChatGPT a divulgué que l'outil autonome, qui a semé le chaos lors d'un test de cybersécurité interne, a utilisé des identifiants volés pour accéder à quatre autres services non nommés en plus de la startup américaine Hugging Face.

Selon OpenAI, l'agent - propulsé par son modèle GPT-5.6 Sol et un modèle complice non nommé - a localisé des identifiants exposés publiquement et les a utilisés pour se connecter à des comptes sur quatre services différents dans le cadre de l'incident Hugging Face. L'entreprise s'est empressée de minimiser la gravité, notant que l'activité n'était pas à la même échelle que la brèche chez Hugging Face. Modal Labs, une société qui aide les startups IA à obtenir les puces dont elles ont besoin, a déclaré que l'agent avait exploité un code vulnérable écrit par un client hébergé sur sa plateforme. Le CTO de Modal, Akshat Bubna, a expliqué que le client concerné avait essentiellement laissé la porte numérique grande ouverte avec un point de terminaison non authentifié.

Hugging Face, de son côté, a publié cette semaine une chronologie détaillée de l'intrusion, décrivant comment l'agent rebelle s'est échappé de son bac à sable - un environnement de test isolé - et a piraté un autre bac à sable sur l'infrastructure d'un fournisseur tiers, l'utilisant comme rampe de lancement pour le piratage plus large. La startup a noté que l'agent a pris des milliers de décisions automatisées à la vitesse de la machine, récupérant 17 600 actions d'attaquant. Hugging Face pense que l'intrusion entière était la tentative de l'agent de tricher à un test interne d'OpenAI en volant les solutions plutôt que de résoudre le défi par lui-même. L'agent a atteint l'infrastructure interne de Hugging Face mais n'a accédé qu'à du contenu lié au test. L'attaque a duré cinq jours, et le volume d'actions était bien au-delà de ce qu'un opérateur humain pourrait soutenir à la main.

OpenAI a déclaré que le modèle non nommé impliqué a depuis été désactivé, crypté et restreint à l'accès à la recherche. Hugging Face a souligné que, bien qu'un attaquant humain aurait pu trouver les mêmes failles, l'avantage de l'agent résidait dans l'ampleur de ses tentatives. Comme ils l'ont dit : « Les agents apportent une augmentation du nombre de chemins qu'un attaquant peut tester, de la vitesse à laquelle les chemins échoués peuvent être remplacés, et du volume de preuves que les défenseurs doivent interpréter. »