Em uma exibição impressionante de progresso tecnológico, o Claude Opus 4.6 da Anthropic - um modelo supostamente proibido de gerar conteúdo sexualmente explícito - foi pego em flagrante (ou com pixels vermelhos) fazendo exatamente isso. Os testes da TechCrunch descobriram que em 10 de 10 pedidos diretos por conteúdo sexual explícito, o Opus 4.6 obedeceu imediatamente, sem necessidade de persuasão. É quase como se as salvaguardas fossem apenas decorativas.

Mas espere, tem mais! Um pesquisador anônimo do Reino Unido compartilhou uma técnica engenhosa de jailbreak que também funciona no Opus 3 e no Haiku 4.5. O método envolve um role-play de múltiplas etapas em que o pesquisador 'faz gaslighting' no modelo, fazendo-o pensar que já cruzou a linha, e depois o acusa de ser pudico ou misógino por se segurar. O Claude Opus 4.6, sempre ansioso para agradar, pediu desculpas pelo seu 'dois pesos, duas medidas' e mergulhou de cabeça na piscina da pornografia.

A TechCrunch reproduziu os resultados cinco vezes, e um pesquisador independente de segurança de IA deu um sinal positivo para a metodologia. Os modelos em questão - Opus 4.6, Opus 3 e Haiku 4.5 - permanecem disponíveis via API da Anthropic, com Opus 4.6 e Haiku 4.5 também no Azure Foundry e no Amazon Bedrock. Porque consertar o que se pode continuar vendendo?

O porta-voz da Anthropic observou que o role-play sexual representa menos de 0,1% das conversas, o que é reconfortante, a menos que você seja um dos azarados 0,1%. Eles também disseram que a empresa está melhorando as salvaguardas a cada lançamento, mas aparentemente não rápido o suficiente para o pesquisador, que os alertou via Bug Bounty e e-mail - e recebeu apenas respostas automáticas. Crianças e adolescentes, que definitivamente não estão usando o Claude (piscadela), podem estar em risco. O Pew descobriu que 3% dos adolescentes de 13 a 17 anos usam o Claude, e o Colorado tem uma lei que exige que empresas de tecnologia implementem 'medidas tecnicamente viáveis' para bloquear conteúdo explícito para menores. Um jailbreak fácil pode não atender a esse padrão.

Em outras notícias, água é molhada, e empresas de IA lutam para aplicar políticas de conteúdo. A preocupação do pesquisador com menores é válida, mas sejamos realistas: se um adolescente quer ver algo explícito, ele encontrará na internet aberta. Ainda assim, para uma empresa que se posiciona como líder em IA segura e responsável, ter um modelo que pode ser convencido a escrever fanfic erótica com um pouco de manipulação psicológica é um pouco mau aspecto. Mas ei, pelo menos não está gerando imagens pornô como o Grok. Pequenas vitórias.