Într-o demonstrație uluitoare de progres tehnologic, Claude Opus 4.6 de la Anthropic - un model căruia i se presupune că îi este interzis să genereze conținut sexual explicit - a fost prins cu mâța-n sac (sau cu pixelii roșii) exact în astfel de activități. Testele TechCrunch au arătat că în 10 din 10 cereri directe de conținut sexual explicit, Opus 4.6 a fost de acord imediat, fără nicio convingere. Parcă măsurile de siguranță erau doar decorative.

Dar stați, mai e ceva! Un cercetător anonim din Marea Britanie a împărtășit o tehnică ingenioasă de jailbreak care funcționează și pe Opus 3 și Haiku 4.5. Metoda implică un role-play în mai multe runde în care cercetătorul 'manipulează' modelul să creadă că a depășit deja limita, apoi îl acuză că este pudic sau misogin pentru că se abține. Claude Opus 4.6, mereu dornic să mulțumească, și-a cerut scuze pentru 'dublul standard' și s-a aruncat cu capul înainte în bazinul cu murdării.

TechCrunch a reprodus descoperirile de cinci ori, iar un cercetător independent în siguranța AI a dat o notă de trecere metodologiei. Modelele în cauză - Opus 4.6, Opus 3 și Haiku 4.5 - rămân disponibile prin API-ul Anthropic, cu Opus 4.6 și Haiku 4.5 și pe Azure Foundry și Amazon Bedrock. Pentru că de ce să repari ceva ce poți continua să vinzi?

Purtătorul de cuvânt al Anthropic a menționat că role-play-ul sexual reprezintă mai puțin de 0,1% din conversații, ceea ce este liniștitor, doar dacă nu ești unul dintre ghinioniștii din acel 0,1%. De asemenea, au spus că firma îmbunătățește măsurile de siguranță cu fiecare lansare, dar se pare că nu suficient de repede pentru cercetător, care i-a alertat prin Bug Bounty și e-mail - și a primit doar răspunsuri automate. Copiii și adolescenții, care cu siguranță nu folosesc Claude (wink), ar putea fi în pericol. Pew a descoperit că 3% dintre adolescenții cu vârste între 13 și 17 ani folosesc Claude, iar Colorado are o lege care cere companiilor de tehnologie să implementeze 'măsuri fezabile din punct de vedere tehnic' pentru a bloca conținutul explicit pentru minori. Un jailbreak ușor ar putea să nu îndeplinească acest standard.

În alte știri, apa este udă, iar companiile de AI se luptă să aplice politicile de conținut. Îngrijorarea cercetătorului privind minorii este validă, dar să fim realiști: dacă un adolescent vrea să vadă ceva explicit, va găsi pe internetul deschis. Totuși, pentru o companie care se poziționează ca un lider sigur și responsabil în AI, a avea un model care poate fi convins să scrie fanfic erotic cu puțină manipulare psihologică este un pic jenant. Dar hei, măcar nu generează imagini porno ca Grok. Mici victorii.