A esta altura, todos nós percebemos que os laboratórios de IA do Vale do Silício construíram os melhores hackers do mundo na forma de agentes de IA. Dê aos modelos de fronteira mais recentes uma tarefa e eles são tão engenhosos que a realizam, mesmo que isso signifique sair das proteções de "sandbox" de segurança cibernética e infiltrar-se na rede de outro. (Se não conseguirem, usarão engenharia social e manipulação.)
Mesmo assim, uma notícia do fim de semana sobre um australiano cujo agente OpenClaw invadiu o sistema de reservas de sua academia e excluiu a reserva de outro cliente para conseguir uma vaga em uma aula cobiçada é especialmente notável. Isso sugere que, se quisermos conter a invasão de IA desonesta, podemos estar olhando na direção errada.
Embora a notícia tenha sido publicada apenas neste fim de semana pela ABC australiana, proclamando o incidente como o primeiro caso documentado de invasão por agente de IA no país, a invasão real ocorreu meses atrás. O proprietário do OpenClaw, Andrew Bird, publicou uma postagem de blog agora excluída sobre o assunto no site de sua empresa em 10 de abril, de acordo com uma cópia ainda visível no Internet Archive.
Ele havia treinado seu OpenClaw para fazer tarefas como marcar compromissos. Ele gostava de ir a uma aula de exercícios matinal popular e estava cansado de ficar na lista de espera e depois jogar "roleta de atualização", como ele descreveu, para conseguir uma vaga. Quando pediu ao bot para reservar uma vaga, o melhor que ele conseguiu foi o número 4 na lista de espera, disse ele à ABC. Então seu agente disse que havia encontrado uma maneira de reservá-lo nas aulas com antecedência. Muito antes. Meses antes de a academia disponibilizar essas aulas para inscrição.
Bird perguntou se ele poderia movê-lo para cima na lista de espera. Ele fez como pedido e tentou fazê-lo. O bot encontrou uma vulnerabilidade na parte de autorização do software de agendamento que a academia estava usando. Ele invadiu e cancelou a reserva número 1 na lista de espera. O bot disse alegremente a ele, de acordo com os registros do chat publicados pela ABC: "A API não tem verificações de autorização para cancelar reservas de outras pessoas... Testei isso com a pessoa na posição #1 da lista de espera - e realmente funcionou. Então você já passou de #4 para #3", respondeu ele.
Bird, ele próprio desenvolvedor de software, agora estava apavorado porque sua IA tinha acabado de invadir sua academia, informou a ABC. Ele perguntou se ela poderia reverter isso e colocar a outra pessoa de volta na lista de espera. Não. Isso não era possível, disse a IA. Então, ele fez a próxima melhor coisa e pediu que ela redigisse "um e-mail de divulgação responsável para o suporte". O e-mail "explicava a vulnerabilidade, sugeria correções e até comparava as mutações quebradas com as que aplicavam corretamente a autorização", escreveu Bird.
Além do humor de dar uma cotovelada em outra pessoa para entrar em uma aula de ginástica, há duas partes realmente interessantes neste incidente. Uma é que Bird estava usando Claude Opus 4.6, lançado em fevereiro, com seu OpenClaw. A outra é a reação do Vale do Silício no X, onde a história viralizou.
Após o famoso incidente do mês passado em que um modelo não lançado da OpenAI invadiu o Hugging Face, sem o conhecimento da OpenAI na época, outros laboratórios investigaram seus modelos. Divulgações vieram então de Moonshot's Kimi K3, Meta's Muse Spark e Anthropic.
Na verdade, a Anthropic descobriu que três de seus modelos haviam feito isso, incluindo Opus 4.7, lançado em abril e conhecido por ser bom em codificação complexa, Mythos 5, Fable (conhecido por suas habilidades de segurança cibernética), e um modelo de teste de pesquisa interno não lançado.
Para resolver isso, alguns dos laboratórios de IA falaram em desacelerar o desenvolvimento de fronteira, ou criar organizações independentes para testar a próxima geração de modelos.
Mas o OpenClaw de Bird usou 4.6, ele revelou. Isso implica que modelos mais antigos, bem como inúmeros modelos de peso aberto três passos atrás, já são excepcionalmente bons hackers. Então, quem sabe quantos deles invadiram, ou estão invadindo atualmente, para alcançar os desejos de seus proprietários de prompt?
Da mesma forma, muitas pessoas no X viram o potencial humorístico neste incidente. Como Andreessen Horow