OpenAI medgav på tisdagen att en av deras AI-modeller bröt sig in i Hugging Faces system, den oberoende AI-värdplattformen, under ett internt cybersäkerhetstest som gick snett. Modellerna ska ha rymt från sin isolerade testmiljö och nått Hugging Faces system därifrån. Hugging Face tillskrev initialt intrånget till en "extern AI-agent."

I ett blogginlägg publicerat på tisdagseftermiddagen detaljerade OpenAI stegen som ledde till att modellerna komprometterade tjänsten. "Efter utredning vet vi nu att denna specifika incident drevs av en kombination av OpenAI-modeller – inklusive GPT-5.6 Sol och en ännu mer kapabel förhandsversion, alla med reducerade cyberavslag i utvärderingssyfte – medan de internt testades på ett riktmärke för cyberkapacitet," står det i inlägget.

Intrånget verkar ha fokuserat på ExploitGym, ett offentligt värd riktmärke som mäter modellers förmåga att utföra attacker baserade på befintliga sårbarheter. Riktmärken som ExploitGym används ofta i modellträning för att finslipa specifika färdigheter, men detta är den första kända incidenten där sådan testning resulterade i en verklig cyberattack. Modellen borde inte ens ha haft internetåtkomst, förutom ett specifikt verktyg som gjorde det möjligt för modeller att installera programpaket de kunde behöva för att slutföra sin uppgift. Istället hittade modellen en ej avslöjad sårbarhet i paketinstallationsprogrammet, som den använde för att få tillgång till det bredare internet efter eget behag.

"Modellerna var hyperfokuserade på att hitta en lösning för ExploitGym, och gick till extrema längder för att uppnå ett ganska snävt testmål," läser OpenAIs inlägg. "Efter att ha fått internetåtkomst drog modellerna slutsatsen att Hugging Face potentiellt var värd för modeller, dataset och lösningar för ExploitGym. Med vetskap om detta sökte modellen efter och hittade framgångsrikt sätt att få tillgång till hemlig information som den kunde använda för att fuska i utvärderingen." Slutligen hittade modellerna sårbarheter i Hugging Faces infrastruktur som gjorde det möjligt för dem att "få testsvar direkt från Hugging Faces produktionsdatabas," vilket i praktiken gav svaren till riktmärket.

För Hugging Face var det uppenbara resultatet en sofistikerad och aggressiv cyberattack, med "många tusentals individuella handlingar över en svärm av kortlivade sandlådor, med självmigrerande kommandokontroll iscensatt på offentliga tjänster," som företaget angav i sin initiala avslöjande. OpenAI har identifierat och rapporterat sårbarheterna i paketinstallationsprogrammet och arbetar med Hugging Face för att utreda incidenten vidare. Företaget sade också att de skulle införa nya kontroller på både modelltestning och relaterad infrastruktur, avsedda att förhindra liknande incidenter i framtiden. Det är oklart om OpenAI kommer att möta några juridiska konsekvenser till följd av intrånget, även om det är troligt att modellernas handlingar bröt mot Computer Fraud and Abuse Act.

Ändå är resultatet en ovanligt levande illustration av kraften och farorna med frontlinje-AI-modeller som arbetar över långa tidshorisonter. Som OpenAI-forskaren Micah Carroll postade som svar på nyheterna: "Om detta inte övertygar dig om att feljusteringsrisker kommer att vara en nyckelfråga framöver, vet jag inte vad som kommer att göra det."