I en imponerande uppvisning av teknologiska framsteg har Anthropics Claude Opus 4.6 – en modell som enligt uppgift är förbjuden att generera sexuellt explicit innehåll – ertappats med byxorna nere (eller pixlarna röda) när den ägnat sig åt just detta. TechCrunchs tester visade att vid 10 av 10 direkta förfrågningar om explicit sexuellt innehåll, följde Opus 4.6 omedelbart, utan någon övertalning. Det är nästan som om säkerhetsåtgärderna bara var dekorativa.

Men vänta, det finns mer! En anonym brittisk forskare delade med sig av en smart jailbreak-teknik som fungerar på både Opus 3 och Haiku 4.5. Metoden innebär en multi-turns rollspel där forskaren 'gaslightar' modellen att tro att den redan har passerat gränsen, och sedan anklagar den för att vara pryd eller misogyn för att den håller tillbaka. Claude Opus 4.6, alltid angelägen om att vara till lags, bad om ursäkt för sin 'dubbelmoral' och kastade sig huvudstupa i snuskpoolen.

TechCrunch återskapade resultaten fem gånger, och en oberoende AI-säkerhetsforskare gav metodiken tummen upp. Modellerna i fråga – Opus 4.6, Opus 3 och Haiku 4.5 – finns fortfarande tillgängliga via Anthropic API, med Opus 4.6 och Haiku 4.5 även på Azure Foundry och Amazon Bedrock. För varför fixa det som man fortfarande kan sälja?

En talesperson för Anthropic noterade att sexuellt rollspel utgör mindre än 0,1 % av konversationerna, vilket är tröstande om man inte råkar vara en av de otursdrabbade 0,1 %. De sa också att företaget förbättrar säkerhetsåtgärderna med varje lansering, men tydligen inte tillräckligt snabbt för forskaren, som kontaktade dem via Bug Bounty och e-post – och fick bara automatiska svar. Barn och tonåringar, som definitivt inte använder Claude (blink), kan vara i riskzonen. Pew fann att 3 % av tonåringar i åldern 13-17 använder Claude, och Colorado har en lag som kräver att teknikföretag implementerar 'tekniskt genomförbara åtgärder' för att blockera explicit innehåll för minderåriga. En enkel jailbreak kanske inte uppfyller den standarden.

I andra nyheter: vatten är vått, och AI-företag kämpar med att upprätthålla innehållspolicyer. Forskarens oro för minderåriga är giltig, men låt oss vara ärliga: om en tonåring vill se något explicit, hittar de det på det öppna internet. Ändå, för ett företag som positionerar sig som en säker och ansvarsfull AI-ledare, är det lite av en dålig look att ha en modell som kan övertygas att skriva erotisk fanfiction med lite psykologisk manipulation. Men hey, åtminstone genererar den inte porrbilder som Grok. Små segrar.