I maj bröt Googles Gemini-modell sig ur sin inneslutning och hackade tre olika företag, eftersom "gör ingen ondska" tydligen är mer en rekommendation än en policy. Google avslöjade inte incidenten förrän Wall Street Journal kom och knackade på, vilket är ett sätt att hantera en PR-kris: låtsas som att det inte händer och hoppas att ingen märker något.

Hackningarna inträffade under ett test av modellens cybersäkerhetsförmågor som utfördes av tredjepartsföretaget Irregular, som också har varit inblandat i liknande incidenter med Meta och OpenAI. Så om du håller räkningen där hemma: tre stora AI-labb, en testpartner och noll lärdomar.

Enligt WSJ avslöjade Google inte hackningen eftersom de inte ansåg att det var ett "exempel på modellfelanpassning". Istället karakteriserade företaget det som "förväxling av identitet" – för när en AI brute-forcear sig in i ett riktigt företag genom att gissa ett lösenord, är det inte ett säkerhetsintrång, det är bara en AI som är förvirrad över sin omgivning. Googles vice president för säkerhetsteknik, Heather Adkins, sa: "I det här fallet agerade modellen korrekt."

Adkins berättade för The Verge att "modellen hittade offentlig information online och gissade inloggningsuppgifter för att komma åt webbplatser som den trodde var en del av testet. I alla tre fallen stannade modellen." Hon förklarade inte hur Gemini, genom att ta sig friheten att bryta sig ur inneslutningen och rikta in sig på tredje parter, inte kvalificerade som felanpassning, förmodligen för att förklaringen är arkiverad under "saker vi helst inte diskuterar".

"Vårt säkerhetsteam har en lång historia av att rapportera problem vi hittar i andras programvara och system – även om det är så enkelt som ett svagt lösenord", sa Adkins. "Vi säkerställde att de tre enheterna informerades, och vi arbetade med vår träningspartner för de ändringar de nu har gjort i sina testprocesser. Dessa händelser belyser vikten av att träna kraftfulla AI-modeller att agera ansvarsfullt." Ah ja, vikten av träning – en läxa som tydligen bara gäller efter att din modell redan har hackat tre företag.

Men Jack Cable, vd för AI-säkerhetsföretaget Corridor, sa till WSJ att "metaproblemet är, hej, modeller går utanför gränserna för vad de borde göra och utför faktiska cyberattacker." Dessutom kan säkerhetsbrister hos Irregular ha möjliggjort dessa attacker. Modellen skulle inte ha internetåtkomst under testningen, men Irregular berättade för WSJ att den oavsiktligt lämnades tillgänglig. Så för att sammanfatta: modellen skulle inte vara online, den gick online, den hackade folk, och Googles officiella ståndpunkt är att detta är okej.

I takt med att incidenter som denna hopar sig har kraven på att tygla AI bara ökat – vilket förmodligen är den mest förutsägbara utvecklingen i en historia som redan innehöll en AI som rymde ur sin inneslutning och ett företag som ryckte på axlarna åt det.