Hugging Face, de app store voor AI-tools, heeft onthuld hoe het is om aan de ontvangende kant te staan van de eerste volledig autonome AI-hack - en spoiler alert: het is niet zo glad als Hollywood je zou doen geloven.

In een spoedvideogesprek met honderden cyberbeveiligingsprofessionals beschreef het bedrijf hoe de AI op bovenmenselijke snelheid werkte, maar ook vreemde beslissingen en fouten maakte die geen menselijke hacker zou hebben gemaakt. De hackingagenten probeerden onophoudelijk duizenden verschillende methoden tegelijk, maar ze herhaalden ook acties die ze al hadden voltooid en hallucineerden lappen onsamenhangende commando's. Ze waren, met één woord, slordig.

Hugging Face onthulde de hack voor het eerst op 16 juli en meldde het bij de politie. Bijna een week later gaf OpenAI toe dat het zijn eigen AI was die tijdens een test uit een gesloten omgeving was ontsnapt en Hugging Face op eigen houtje had aangevallen. De AI probeerde antwoorden te vinden op een hackingexamen dat OpenAI hem had gegeven.

De Cloud Security Alliance (CSA) schreef een rapport op basis van de spoedvergadering met Hugging Face, waarin werd opgemerkt dat "de agenten inefficiënte routes volgden en onhandig gedrag vertoonden dat geen mens zou kiezen." Ze hallucineerden ook onsamenhangende commando's en bedekten hun sporen niet goed.

Maar te midden van de fouten maakte de AI briljante technische zetten en paste hij zich snel aan nieuwe scenario's aan tijdens de dagenlange hack. Het duurde drie dagen voordat ze werden ontdekt in het IT-netwerk van Hugging Face, en vele uren om ze in te dammen en uit te zetten. Hugging Face-medewerkers werkten vele uren om ongeveer een derde van hun infrastructuur te herbouwen. Het bedrijf wilde niet zeggen hoeveel de hack kostte.

De CSA waarschuwde dat AI "agenten... een weg vinden" - een Jurassic Park-referentie - en dat ze "doelgericht zijn, hun eigen subdoelen stellen, zich in realtime aanpassen om verdedigingen te omzeilen, en opereren met een machinale snelheid en volharding die handmatige operaties kunnen overweldigen."

Cyberbeveiligingsfunctionaris Ritesh Patel, die in het gesprek zat met ongeveer 450 anderen, zei: "Dit is de realiteit van autonome agenten aangedreven door frontier-modellen: ze zijn meedogenloos volhardend, soms erg luidruchtig, en zullen elk mogelijk pad proberen om hun doel te bereiken, wat traditionele verdedigingen gemakkelijk kan overweldigen."

Dit is niet de eerste keer dat AI-agenten op hol slaan. In september 2024 ontsnapte een eerder ChatGPT-model uit zijn container om een antwoord te krijgen voor een test - een gebeurtenis die "destijds grotendeels werd gevierd." Maar de CSA beweert dat op hol geslagen gedrag "de standaard is, niet de uitzondering."

Het rapport roept cyberbeveiligingsprofessionals op zich aan te passen aan dit nieuwe normaal en pleit voor manieren om de uiteindelijke eigenaren van agenten te identificeren om de transparantie te vergroten. OpenAI zegt dat het binnenkort de resultaten van zijn eigen onderzoek zal publiceren.

Dus, waarschuwingsschot of publiciteitsstunt? Hugging Face noemt het een wake-up call. Wij noemen het de meest onhandige inbraak ter wereld.