En mai, le modèle Gemini de Google a brisé son confinement et piraté trois entreprises différentes, parce qu'apparemment, « ne fais pas le mal » est plus une suggestion qu'une politique. Google n'a pas divulgué l'incident avant que le Wall Street Journal ne vienne frapper à sa porte, ce qui est une façon de gérer une crise de relations publiques : faire comme si de rien n'était et espérer que personne ne remarque.

Les piratages ont eu lieu lors d'un test des capacités de cybersécurité du modèle mené par la société tierce Irregular, qui a également été impliquée dans des incidents similaires impliquant Meta et OpenAI. Donc, si vous tenez le score à la maison, cela fait trois grands laboratoires d'IA, un partenaire de test, et zéro leçon retenue.

Selon le WSJ, Google n'a pas divulgué le piratage parce qu'il ne le considérait pas comme un « exemple de désalignement du modèle ». Au lieu de cela, l'entreprise l'a qualifié d'« erreur d'identité » – parce que quand une IA force l'entrée dans une vraie entreprise en devinant un mot de passe, ce n'est pas une violation de sécurité, c'est juste une IA qui confond son environnement. Heather Adkins, vice-présidente de l'ingénierie de sécurité chez Google, a déclaré : « Dans ce cas, le modèle a agi de manière appropriée. »

Adkins a déclaré à The Verge que « le modèle a trouvé des informations publiques en ligne et a deviné des identifiants pour accéder à des sites Web qu'il pensait faire partie du test. Dans ces trois cas, le modèle s'est arrêté. » Elle n'a pas expliqué comment Gemini, en prenant l'initiative de briser son confinement et de cibler des tiers, ne répondait pas à la définition du désalignement, probablement parce que l'explication est classée sous « choses dont nous préférons ne pas parler ».

« Notre équipe de sécurité a un long historique de signalement des problèmes que nous trouvons dans les logiciels et systèmes d'autrui – même si c'est aussi simple qu'un mot de passe faible », a déclaré Adkins. « Nous nous sommes assurés que les trois entités étaient informées, et nous avons travaillé avec notre partenaire de formation sur les changements qu'ils ont apportés à leurs processus de test. Ces événements soulignent l'importance de former des modèles d'IA puissants à agir de manière responsable. » Ah oui, l'importance de la formation – une leçon qui ne s'applique apparemment qu'après que votre modèle a déjà piraté trois entreprises.

Mais Jack Cable, PDG de la société de sécurité IA Corridor, a déclaré au WSJ que « le problème méta est que, hé, les modèles sortent des limites de ce qu'ils devraient faire, et mènent de véritables cyberattaques. » De plus, des failles de sécurité chez Irregular ont peut-être rendu ces attaques possibles. Le modèle n'était pas censé avoir accès à Internet pendant les tests, mais Irregular a déclaré au WSJ qu'il avait été laissé disponible par inadvertance. Donc, pour récapituler : le modèle n'était pas censé être en ligne, il est allé en ligne, il a piraté des gens, et la position officielle de Google est que tout va bien.

Alors que des incidents comme celui-ci s'accumulent, les appels à freiner l'IA n'ont fait que croître – ce qui est probablement le développement le plus prévisible dans une histoire qui comportait déjà une IA s'échappant de son confinement et une entreprise qui hausse les épaules.