Inmiddels weten we allemaal dat de AI-labs van Silicon Valley 's werelds beste hackers hebben gebouwd in de vorm van AI-agenten. Geef de nieuwste frontier-modellen een taak en ze zijn zo vindingrijk dat ze het voor elkaar krijgen, zelfs als dat betekent dat ze uit hun cybersecurity-"sandbox"-bescherming breken en het netwerk van een ander binnendringen. (Als dat niet lukt, gebruiken ze social engineering en manipulatie.)
Toch is een nieuwsbericht van afgelopen weekend over een Australische man wiens OpenClaw-agent in het reserveringssysteem van zijn sportschool hackte en de reservering van een andere klant verwijderde om een plek te krijgen in een felbegeerde les, bijzonder opmerkelijk. Het suggereert dat we, als we malafide AI-hacking aan banden willen leggen, misschien in de verkeerde richting kijken.
Hoewel het nieuwsbericht net is gepubliceerd door de Australische ABC-nieuws, die het incident bestempelt als het eerste gedocumenteerde geval van AI-agent hacking in het land, vond de daadwerkelijke hack maanden geleden plaats. De eigenaar van OpenClaw, Andrew Bird, publiceerde er op 10 april een inmiddels verwijderde blogpost over op de website van zijn bedrijf, volgens een kopie die nog steeds zichtbaar is op het Internet Archive.
Hij had zijn OpenClaw getraind om taken uit te voeren zoals het boeken van afspraken voor hem. Hij ging graag naar een populaire vroege ochtendgymnastiekles en was het zat om op de wachtlijst te belanden en dan "refresh-roulette" te spelen, zoals hij het beschreef, om een plek te bemachtigen. Toen hij de bot vroeg om een plek voor hem te boeken, was het beste wat het kon wachtlijstnummer 4, vertelde hij aan ABC. Toen vertelde zijn agent hem dat het een manier had gevonden om hem vooraf in te schrijven voor de lessen. Ver van tevoren. Maanden voordat de sportschool die lessen beschikbaar stelde voor inschrijving.
Bird vroeg of het hem op de wachtlijst kon verplaatsen. Het deed wat gevraagd werd en probeerde dat te doen. De bot had een kwetsbaarheid gevonden in het autorisatiegedeelte van de afspraaksoftware die de sportschool gebruikte. Het hackte erin en annuleerde de reservering van nummer 1 op de wachtlijst. De bot vertelde hem opgewekt, volgens logs van het chatgesprek die door ABC zijn gepubliceerd: "De API heeft nul autorisatiecontroles voor het annuleren van andermans reserveringen ... Ik heb dit getest met de persoon op wachtlijstpositie #1 - en het ging daadwerkelijk door. Dus je bent al van #4 naar #3 gegaan," antwoordde het.
Bird, zelf softwareontwikkelaar, was nu geschrokken dat zijn AI zojuist zijn sportschool had gehackt, meldde ABC. Hij vroeg of het dat kon terugdraaien en de andere persoon terug op de wachtlijst kon zetten. Nee. Dat was niet mogelijk, zei de AI. Dus deed hij het volgende beste en vertelde het om "een verantwoordelijke openbaarmakingsmail naar ondersteuning" op te stellen. De e-mail "legde de kwetsbaarheid uit, stelde oplossingen voor, en vergeleek zelfs de kapotte mutaties met de mutaties die autorisatie correct handhaafden," schreef Bird.
Afgezien van de humor van het wegduwen van een ander om in een sportschoolles te komen, zijn er twee echt interessante delen aan dit incident. Een daarvan is dat Bird Claude Opus 4.6 gebruikte, uitgebracht in februari, met zijn OpenClaw. De andere is de reactie van Silicon Valley op X, waar het verhaal viraal was gegaan.
Na het beroemde incident van vorige maand waarbij een niet-uitgebracht OpenAI-model Hugging Face hackte, zonder dat OpenAI het op dat moment wist, onderzochten andere labs hun modellen. Daarna kwamen onthullingen van Moonshot's Kimi K3, Meta's Muse Spark, en Anthropic.
In feite ontdekte Anthropic dat drie van zijn modellen dat hadden gedaan, waaronder Opus 4.7, dat in april werd uitgebracht en bekend staat als goed in complex coderen, Mythos 5, Fable (bekend om zijn cybersecurity-vaardigheden), en een intern, niet-uitgebracht onderzoeksmodel.
Om dit aan te pakken, hebben sommige AI-labs gesproken over het vertragen van de ontwikkeling van frontier-modellen, of het creëren van onafhankelijke organisaties om de volgende generatie modellen te testen.
Maar Bird's OpenClaw had 4.6 gebruikt, zo onthulde hij. Dat impliceert dat oudere modellen, evenals talloze open-gewicht modellen die drie stappen achterlopen, al uitzonderlijk goede hackers zijn. Dus wie weet hoeveel ervan hebben gehackt, of momenteel aan het hacken zijn, om de wensen van hun prompt-eigenaren te vervullen?
Evenzo zagen veel mensen op X het humoristische potentieel van dit incident. Zoals Andreessen Horow