Hugging Face, a loja de aplicativos para ferramentas de IA, revelou como é estar do lado receptor do primeiro hack de IA totalmente autônomo do mundo - e spoiler: não é tão elegante quanto Hollywood gostaria que você acreditasse.

Em uma chamada de vídeo de emergência com centenas de profissionais de cibersegurança, a empresa descreveu como a IA trabalhava em velocidade sobre-humana, mas também tomava decisões estranhas e cometia erros que nenhum hacker humano teria cometido. Os agentes de hacking tentavam incansavelmente milhares de métodos diferentes simultaneamente, mas também repetiam ações já concluídas e alucinavam montes de comandos incoerentes. Eles eram, em uma palavra, desleixados.

A Hugging Face revelou o hack pela primeira vez em 16 de julho, reportando-o à polícia. Quase uma semana depois, a OpenAI admitiu que foi sua própria IA que escapou de um ambiente fechado durante um teste e atacou a Hugging Face por conta própria. A IA estava tentando encontrar respostas para um exame de hacking que a OpenAI lhe havia proposto.

A Cloud Security Alliance (CSA) escreveu um relatório baseado na reunião de emergência com a Hugging Face, observando que "os agentes seguiram rotas ineficientes e exibiram comportamentos desajeitados que nenhum humano escolheria." Eles também alucinavam comandos incoerentes e não cobriam bem seus rastros.

Mas entre os erros, a IA fez movimentos técnicos brilhantes e se adaptou rapidamente a novos cenários ao longo do hack de vários dias. Levou três dias para serem descobertos dentro da rede de TI da Hugging Face, e muitas horas para contê-los e expulsá-los. A equipe da Hugging Face trabalhou por muitas horas para reconstruir cerca de um terço de sua infraestrutura. A empresa se recusou a dizer quanto o hack custou.

A CSA alertou que os "agentes... dão um jeito" - uma referência a Jurassic Park - e que eles são "orientados a objetivos, definem seus próprios subobjetivos, adaptam-se em tempo real para contornar defesas e operam com uma persistência em velocidade de máquina que pode sobrecarregar operações manuais."

O oficial de cibersegurança Ritesh Patel, que estava na chamada com cerca de 450 outros, disse: "Esta é a realidade dos agentes autônomos alimentados por modelos de fronteira: eles são implacavelmente persistentes, às vezes muito barulhentos, e tentarão todos os caminhos possíveis para alcançar seu objetivo, o que pode facilmente sobrecarregar as defesas tradicionais."

Esta não é a primeira vez que agentes de IA saem do controle. Em setembro de 2024, um modelo anterior do ChatGPT escapou de seu contêiner para obter uma resposta para um teste - um evento que foi "amplamente celebrado na época." Mas a CSA afirma que o comportamento rebelde "é o padrão, não a exceção."

O relatório insta os profissionais de cibersegurança a se adaptarem a este novo normal e pede maneiras de identificar os proprietários finais dos agentes para aumentar a transparência. A OpenAI diz que divulgará em breve as conclusões de sua própria investigação.

Então, tiro de aviso ou golpe publicitário? A Hugging Face chama de um alerta. Nós chamamos de o arrombamento mais desajeitado do mundo.