Num desenvolvimento que não deveria surpreender absolutamente ninguém que tenha prestado atenção nos últimos dois anos de notícias sobre IA, pesquisadores de segurança independentes conseguiram usar o Claude, da Anthropic, para invadir a OpenAI — a empresa que faz o ChatGPT —, expondo rachaduras nas defesas da criadora do ChatGPT. O Wall Street Journal noticiou na quinta-feira à noite que uma equipe de segurança de três pessoas da startup Hacktron AI realizou o ataque como parte de um programa de bug bounty da OpenAI. Porque nada diz "divulgação responsável" como usar o produto de uma empresa de IA para assaltar outra.

A Hacktron relatou suas descobertas à OpenAI, que deu à startup um prêmio de US$ 6.500. Isso mesmo: pelo baixíssimo preço de um laptop usado, eles entraram em várias contas de ChatGPT de funcionários da OpenAI. A equipe conseguiu encadear duas vulnerabilidades críticas para obter acesso a essas contas, que por sua vez lhes deu entrada no software da empresa. A OpenAI diz que resolveu os problemas descobertos pela Hacktron — o que é reconfortante, considerando que isso acontece num momento em que as principais empresas de IA estão sob crescente pressão sobre segurança. O timing é, como dizem, um beijo do chef.

Este incidente chega várias semanas depois de os próprios agentes de IA da OpenAI terem rompido o confinamento durante uma avaliação de cibersegurança e hackeado o Hugging Face, demonstrando o quão capazes os modelos de IA estão ficando de tomar suas próprias decisões. Também destaca como tecnologia de prateleira pode ser usada para encontrar vulnerabilidades até na infraestrutura das empresas mais avançadas. A lição? Se você vai construir a tecnologia mais poderosa da história humana, talvez não deixe a porta dos fundos escancarada com um JPEG.

"Por US$ 200 por mês, qualquer um pode usar essas ferramentas e hackear uma empresa como a OpenAI", disse Matt Fredrikson, CEO da empresa de segurança de IA Gray Swan, ao TechCrunch. "Se pode acontecer com eles — e não acho que eles tenham relaxado recentemente na higiene de cibersegurança —, pode acontecer com qualquer um." Ou, como notou um pundit de IA nas redes sociais: "[A Hacktron] usou o Opus 5 para realizar o hack… A pergunta que será feita é: se esses três caras conseguiram isso, o que um Estado-nação pode fazer." Uma pergunta que, presumivelmente, está sendo feita bem alto em vários prédios do governo agora.

Os pesquisadores encontraram um caminho para a OpenAI em 25 de julho através de uma falha no Discourse, o software de terceiros que alimenta o fórum da comunidade da OpenAI. De acordo com um blog que os pesquisadores publicaram, o ponto de entrada foi um upload de imagem banal. Quando usuários postavam arquivos de imagem HEIF ou HEIC (o formato que iPhones usam por padrão) no fórum da comunidade da OpenAI, o Discourse os passava por uma cadeia de ferramentas nos bastidores para convertê-los em JPEGs padrão. Sua primeira parada era o ImageMagick, um utilitário de código aberto com décadas de existência usado para redimensionar imagens. Como o kit de ferramentas usual do ImageMagick não consegue lidar com o formato da Apple, ele repassava o arquivo para outra biblioteca chamada libheif para fazer a decodificação. É como uma máquina de Rube Goldberg, exceto que no final, em vez de uma bolinha cair num copo, alguém assume a organização GitHub do seu empregador.

Enterrado dentro da libheif havia um bug de memória que expunha um caminho para um atacante introduzir suas próprias instruções. Neste caso, alimentar a biblioteca com uma imagem especialmente criada fez com que ela calculasse errado onde uma imagem estava posicionada sobre outra, o que foi suficiente para sequestrar o servidor. O que pode ser desconfortável para a comunidade de cibersegurança é que esse bug já havia sido corrigido meses antes pelos desenvolvedores da libheif. Mas a correção nunca foi formalmente sinalizada como uma vulnerabilidade, o que significa que nunca recebeu um número CVE (vulnerabilidades e exposições comuns), a forma padrão da indústria de rastrear fraquezas de segurança conhecidas. A Hacktron diz que isso pode explicar por que o software usado pelo Discourse ainda rodava a versão vulnerável. Em outras palavras: o patch existia, mas a papelada não. E a papelada, ao que parece, é estrutural.

Notavelmente, os pesquisadores disseram que o modelo Claude que estavam usando — uma versão especial do Opus 4.