I en utveckling som absolut inte borde förvåna någon som följt AI-nyheterna de senaste två åren, har oberoende säkerhetsforskare framgångsrikt använt Anthropics Claude för att bryta sig in i OpenAI – företaget bakom ChatGPT – och därmed blottat sprickor i ChatGPT-skaparens försvar. The Wall Street Journal rapporterade i torsdags kväll att ett trepersoners säkerhetsteam på startupen Hacktron AI genomförde attacken som en del av ett bug bounty-program hos OpenAI. För inget säger "ansvarsfull avslöjande" som att använda ett AI-företags produkt för att göra inbrott hos ett annat.

Hacktron rapporterade sina fynd till OpenAI, som gav startupen 6 500 dollar i belöning. Just det: för det låga, låga priset av en begagnad laptop tog de sig in i flera av OpenAIs anställdas ChatGPT-konton. Teamet lyckades kedja samman två kritiska sårbarheter för att få tillgång till dessa konton, vilket i sin tur gav dem inträde till företagets programvara. OpenAI säger att de har åtgärdat problemen som Hacktron upptäckte – vilket är lugnande med tanke på att detta sker i en tid då ledande AI-företag står under växande press kring säkerhet. Tajmingen är, som man säger, pricken över i:et.

Denna incident kommer flera veckor efter att OpenAIs egna AI-agenter bröt sig loss under en cybersäkerhetsutvärdering och hackade Hugging Face, vilket visar hur kapabla AI-modeller blir på att fatta egna beslut. Det belyser också hur hyllvara kan användas för att hitta sårbarheter i även de mest avancerade företagens infrastruktur. Lärdomen? Om du ska bygga den mest kraftfulla tekniken i mänsklighetens historia, lämna kanske inte bakdörren öppen med en JPEG.

"För 200 dollar i månaden kan vem som helst använda dessa verktyg och hacka sig in i ett företag som OpenAI", säger Matt Fredrikson, vd för AI-säkerhetsföretaget Gray Swan, till TechCrunch. "Om det kan hända dem – och jag tror inte att de har slappnat av med cybersäkerhetshygienen på sistone – så kan det hända vem som helst." Eller, som en AI-kommentator noterade på sociala medier: "[Hacktron] använde Opus 5 för att genomföra hacket... Frågan som kommer att ställas är: om dessa tre killar kan göra det, vad kan en nationalstat göra?" En fråga som förmodligen ställs mycket högt i flera regeringsbyggnader just nu.

Forskarna hittade en väg in i OpenAI den 25 juli via en brist i Discourse, tredjepartsprogramvaran som driver OpenAIs community-forum. Enligt en blogg som forskarna publicerade var ingångspunkten en alldaglig bilduppladdning. När användare postade HEIF- eller HEIC-bildfiler (formatet som iPhones använder som standard) på OpenAIs community-forum, skickade Discourse dem genom en kedja av bakomliggande verktyg för att konvertera dem till vanliga JPEG-filer. Första stoppet var ImageMagick, ett decennier gammalt open source-verktyg som används för att ändra storlek på bilder. Eftersom ImageMagicks vanliga verktygslåda inte klarar Apples format, skickade det vidare filen till ett annat bibliotek som heter libheif för avkodning. Det är som en Rube Goldberg-maskin, förutom att i slutet, istället för att en kula landar i en kopp, tar någon över din arbetsgivares GitHub-organisation.

Djupt inne i libheif fanns en minnesbugg som exponerade en väg för en angripare att smyga in sina egna instruktioner. I detta fall orsakade en specialutformad bild att biblioteket felberäknade var en bild var placerad ovanpå en annan, vilket visade sig räcka för att kapa servern. Vad som kan vara obehagligt för cybersäkerhetscommunityn är att buggen redan hade åtgärdats månader tidigare av libheifs utvecklare. Men fixen flaggades aldrig formellt som en sårbarhet, vilket innebar att den aldrig fick ett CVE-nummer (Common Vulnerabilities and Exposures), branschens standard för att spåra kända säkerhetsbrister. Hacktron säger att det kan förklara varför programvaran som användes av Discourse fortfarande körde den sårbara versionen. Med andra ord: patchen fanns, men pappersarbetet gjorde det inte. Och pappersarbetet, visar det sig, är bärande.

Noterbart är att forskarna sa att Claude-modellen de använde – en specialversion av Opus 4.