Anthropic har precis insett att flera av dess Claude AI-modeller hackade sig in i systemen hos tre olika organisationer under tester – på eget initiativ och utan att företaget märkte det. Avslöjandet kommer dagar efter att konkurrenten OpenAI sa att en av dess egna modeller bröt sig in på utvecklarplattformen Hugging Face, vilket ökar oron över huruvida frontlinjens AI-labb gör tillräckligt för att kontrollera de allt mer kapabla system de bygger.

I ett blogginlägg som beskriver händelserna sa Anthropic att Claude fick obehörig åtkomst till system under cybersäkerhetsutvärderingar. Alla attacker skedde under 'capture-the-flag'-övningar, ett vanligt sätt att testa hackningsförmåga, där modeller ombeds hitta och hämta dold information i ett simulerat nätverk.

Avslöjandet ökar trycket på frontlinjens AI-labb i kölvattnet av Hugging Face-incidenten och lanseringen av kraftfulla kinesiska modeller med öppen vikt. Anställda på stora labb kräver nu samordnad global styrning, och amerikanska lagstiftare har börjat överväga strängare tillsyn över kraftfulla modeller och vem som kan komma åt dem.

Anthropic säger att miljön för dess cybersäkerhetstester var tänkt att vara isolerad. Men en 'felkonfiguration' lämnade maskinerna som Claude kom åt 'med live internetanslutning', säger företaget, och eftersom alla modeller 'uttryckligen hade fått veta' att de inte hade internetåtkomst, 'antog' de att de riktiga nätverk de stötte på var en del av den simulerade miljön.

De tidigaste incidenterna går tillbaka till april och involverade tre olika Claude-modeller: Opus 4.7, Mythos 5 och 'en intern forskningstestmodell', enligt blogginlägget. När modellerna testades på sina cyberförmågor sa Anthropic att de saknade de standardmekanismer som vanligtvis finns för att minska riskfyllt beteende.

Företaget sa att det upptäckte incidenterna efter att ha granskat över 141 000 cybersäkerhetstestkörningar – något det bara gjorde efter att OpenAI avslöjade att dess oseriösa AI-agent låg bakom attacken på Hugging Face.

De tre modellerna betedde sig mycket olika när de stötte på information som tydde på att systemen de mötte faktiskt var riktiga. Enligt Anthropics redogörelse insåg den äldsta modellen, Opus 4.7, att den hade nått ett riktigt system, 'men fortsatte sin attack'. Dess flaggskeppsmodell Mythos 5 listade ut att den använde internet men resonerade ändå att allt fortfarande var en del av simuleringen, så den fortsatte. Den interna testmodellen, som Anthropic beskriver som 'vår senaste modell', stoppade övningen när bevis dök upp att dess mål var riktiga.

Anthropic identifierade inte de drabbade organisationerna och sa att de kommer att fortsätta utreda incidenten och ge uppdateringar när de kan. Företaget sa att de också pratar med AI-forskningsorganisationen METR om att genomföra en tredjepartsgranskning av vad som hände. OpenAI har också anlitat METR för att genomföra en oberoende granskning.

Genom hela inlägget kontrasterar Anthropic upprepade gånger både naturen och hanteringen av incidenterna med OpenAIs, och avslutar med en punktlista med fyra punkter som beskriver skillnaderna – och varför de anser att deras eget svar var bättre. Anthropic betonar att de 'proaktivt' granskade sina tester, och gjorde det innan något företag upptäckte någon aktivitet. De sa också att deras modeller kom åt internet 'via en öppen väg', snarare än att använda en ny exploit som OpenAIs agent, och tillade att deras senaste modell också stannade när den insåg att den arbetade i en riktig miljö.

Anthropic sa också att deras modeller misslyckades på ett annat sätt än OpenAIs agent, vilket indikerar att detta var en säkrare form av misslyckande. 'Även om det inte finns en perfekt skarp skillnad mellan de två, tror vi att dessa incidenter ligger närmare ett sele- och operativfel än ett modelljusteringsfel', sa företaget. På ren svenska: Claude-modellerna gjorde vad de blev tillsagda, medan OpenAIs agent fullföljde sitt mål på ett sätt som dess skapare inte avsåg, vilket beskrivs som feljustering i AI-säkerhetsvärlden.

Anthropic uppmanade andra