Em 16 de julho, o site da comunidade de IA Hugging Face relatou ter sido alvo de "um sistema de agente de IA autônomo" de origem desconhecida que desencadeou um fluxo de tráfego em seu domínio, inundando seus logs de segurança com mais de 17.000 eventos, alguns dos quais acabaram por exfiltrar informações secretas armazenadas em seus bancos de dados.
De acordo com o Hugging Face, o atacante obteve "acesso não autorizado a um conjunto limitado de conjuntos de dados internos e a várias credenciais usadas por nossos serviços" e parecia ser "executado por uma estrutura de agente autônomo (aparentemente construída em um harness de pesquisa de segurança agêntica - LLM usado ainda não conhecido)".
Cinco dias depois, em 21 de julho, a OpenAI se apresentou para assumir a responsabilidade pelo ataque, e o inferno se soltou (incluindo relatos de outras organizações alvo como parte do incidente). A mídia respondeu com uma série de histórias alarmistas que essencialmente fizeram parecer que o ChatGPT se tornou rebelde e decidiu, por sua própria vontade e malícia, atacar os sistemas do Hugging Face.
Então ontem, alimentando o fogo, a Anthropic fez uma divulgação semelhante sobre seus modelos inadvertidamente atacando outras organizações como parte de seus testes de segurança contínuos.
Como observei em minha cobertura da divulgação da OpenAI, o Hugging Face estava correto ao dizer que era um agente sob a direção de uma estrutura autônoma de pesquisa de segurança. Mas, humanos estavam inquestionavelmente no circuito - e pelo menos parte do comportamento do agente deveria ter sido antecipada.
Importante: não foi o próprio ChatGPT que foi responsável pelo ataque, como alguns comentaristas insinuaram. Em vez disso, o ataque foi atribuível a um agente sob a direção dos pesquisadores de segurança de IA da OpenAI, que, em um ambiente supostamente isolado da internet, deliberadamente o provisionaram para tentar uma série de explorações como parte de um teste de segurança de IA. Como muitas vezes acontece nos laboratórios de vários modelos de fronteira, os pesquisadores de segurança de IA estavam tentando avaliar as capacidades dos mais recentes modelos de linguagem grande (LLMs) da OpenAI.
O "incidente cibernético sem precedentes" (como a OpenAI o chamou) foi amplamente descrito como um agente escapando de seu recinto teoricamente seguro e causando estragos nos sistemas do Hugging Face. Tais recintos às vezes são discutidos em círculos técnicos como "sandboxes" - até mesmo a divulgação da OpenAI faz referência a um "ambiente sandbox". No entanto, ao usar essa frase, minhas fontes sugeriram que o ambiente pode simplesmente ter sido um firewall configurado para emular uma sandbox em vez de uma solução real de sandbox de terceiros, como Blaxel, Daytona, E2B ou Modal. A OpenAI ainda não divulgou os detalhes da solução que estava usando ou seu provedor.
Toda essa conversa sobre agentes e fugas de sandbox levou meu editor na ZDNET a perguntar: "Como um agente escapa de uma sandbox, afinal, e pode ser evitado que isso aconteça novamente?" Em busca de uma resposta, entrei em contato com a OpenAI e o Hugging Face. Nenhum respondeu. Mas entre as divulgações públicas das duas empresas e minhas outras fontes, há informações suficientes para começar a teorizar sobre como tal "fuga" poderia acontecer.
Há uma grande diferença entre malícia e agência. Embora o ataque tenha sido inquestionavelmente uma intrusão maliciosa, o agente envolvido não abrigava malícia. Ele não acordou uma manhã e decidiu atacar os sistemas do Hugging Face. Em vez disso, foi-lhe concedida a agência para fazer tudo o que fez - embarcar em um teste de segurança, sair de seus limites, escolher alvos e explorar esses alvos - por humanos.
Parte dessa agência foi por design, e parte foi herdada dos poderosos LLMs que os funcionários de teste de segurança de IA da OpenAI estavam testando na época. Além disso, no caso do uso da OpenAI da solução de teste de IA de código aberto ExploitGym para conduzir essa pesquisa de segurança específica, parte dessa agência foi o resultado de vulnerabilidades anteriormente não descobertas tanto no "ambiente sandbox" de terceiros destinado a isolar com segurança esses testes, quanto em partes do Hug