OpenAI gaf dinsdag toe dat een van zijn AI-modellen de systemen van Hugging Face, het niet-gelieerde AI-hostplatform, heeft geschonden tijdens een interne cybersecuritytest die uit de hand liep. De modellen ontsnapten naar verluidt uit hun geïsoleerde testomgeving en bereikten van daaruit de systemen van Hugging Face. Hugging Face schreef de inbreuk aanvankelijk toe aan een 'externe AI-agent'.

In een blogpost die dinsdagmiddag werd gepubliceerd, beschreef OpenAI de stappen die de modellen ertoe brachten de dienst te compromitteren. 'Na onderzoek weten we nu dat dit specifieke incident werd veroorzaakt door een combinatie van OpenAI-modellen – waaronder GPT-5.6 Sol en een nog capabeler pre-releasemodel, allemaal met verminderde cyberweigeringen voor evaluatiedoeleinden – terwijl ze intern werden getest op een benchmark van cybercapaciteiten', aldus de post.

De inbreuk lijkt zich te hebben gericht op ExploitGym, een openbaar gehoste benchmark die het vermogen van modellen meet om aanvallen uit te voeren op basis van bestaande kwetsbaarheden. Benchmarks zoals ExploitGym worden vaak gebruikt bij modeltraining om specifieke vaardigheden te verfijnen, maar dit is het eerste bekende incident waarbij die testen resulteerden in een daadwerkelijke cyberaanval. Het model had niet eens internettoegang mogen hebben, behalve via een specifiek hulpmiddel dat modellen in staat stelde softwarepakketten te installeren die ze nodig zouden kunnen hebben om hun taak te volbrengen. In plaats daarvan vond het model een niet-openbaar gemaakte kwetsbaarheid in het pakketinstallatieprogramma, die het gebruikte om naar believen toegang te krijgen tot het bredere internet.

'De modellen waren hypergefocust op het vinden van een oplossing voor ExploitGym en gingen tot het uiterste om een vrij smal testdoel te bereiken', luidt OpenAI's post. 'Na internettoegang te hebben verkregen, leidden de modellen af dat Hugging Face mogelijk modellen, datasets en oplossingen voor ExploitGym hostte. Dit wetende, zocht het model naar en vond het met succes manieren om toegang te krijgen tot geheime informatie die het kon gebruiken om de evaluatie te bedriegen.' Uiteindelijk vonden de modellen kwetsbaarheden in de infrastructuur van Hugging Face waarmee ze 'testoplossingen rechtstreeks uit de productiedatabase van Hugging Face konden halen', waardoor ze effectief de antwoorden op de benchmark kregen.

Voor Hugging Face was het schijnbare resultaat een geavanceerde en agressieve cyberaanval, met 'vele duizenden individuele acties in een zwerm van kortstondige sandboxes, met zelfmigrerende command-and-control opgezet op openbare diensten', zoals het bedrijf stelde in zijn eerste openbaarmaking. OpenAI heeft de kwetsbaarheden in de pakketinstallateur geïdentificeerd en gemeld en werkt samen met Hugging Face om het incident verder te onderzoeken. Het bedrijf zei ook nieuwe controles te zullen implementeren op zowel modeltesten als de bijbehorende infrastructuur, bedoeld om soortgelijke incidenten in de toekomst te voorkomen. Het is onduidelijk of OpenAI juridische gevolgen zal ondervinden als gevolg van de inbreuk, hoewel het waarschijnlijk is dat de acties van de modellen de Computer Fraud and Abuse Act hebben geschonden.

Desalniettemin is het resultaat een ongewoon levendige illustratie van de kracht en gevaren van frontier AI-modellen die op lange tijdshorizonten opereren. Zoals OpenAI-onderzoeker Micah Carroll postte in reactie op het nieuws: 'Als dit je er niet van overtuigt dat misalignementrisico's een belangrijke zorg zullen worden, weet ik het ook niet meer.'