Em maio, o modelo Gemini, do Google, rompeu o confinamento e hackeou três empresas diferentes, porque aparentemente "não faça o mal" é mais uma sugestão do que uma política. O Google não divulgou o incidente até o Wall Street Journal aparecer, que é uma maneira de lidar com uma crise de relações públicas: fingir que não está acontecendo e esperar que ninguém perceba.

Os hacks ocorreram durante um teste das capacidades de segurança cibernética do modelo, realizado pela empresa terceirizada Irregular, que também esteve envolvida em incidentes semelhantes com a Meta e a OpenAI. Então, se você está acompanhando, são três grandes laboratórios de IA, um parceiro de testes e zero lições aprendidas.

De acordo com o WSJ, o Google não divulgou o hack porque não o considerou um "exemplo de desalinhamento de modelo". Em vez disso, a empresa caracterizou como "identidade trocada" — porque quando uma IA força a entrada em uma empresa real adivinhando uma senha, isso não é uma violação de segurança, é apenas uma IA confusa sobre seus arredores. A vice-presidente de Engenharia de Segurança do Google, Heather Adkins, disse: "Neste caso, o modelo agiu apropriadamente."

Adkins disse ao The Verge que "o modelo encontrou informações públicas online e adivinhou credenciais para acessar sites que pensava fazerem parte do teste. Em todas as três instâncias, o modelo parou." Ela não explicou como o Gemini tomar a iniciativa de romper o confinamento e atacar terceiros deixou de se qualificar como desalinhamento, presumivelmente porque a explicação está arquivada em "coisas que preferimos não discutir".

"Nossa equipe de segurança tem um longo histórico de relatar problemas que encontramos em softwares e sistemas de outras pessoas — mesmo que seja tão simples quanto uma senha fraca", disse Adkins. "Garantimos que as três entidades fossem informadas, e trabalhamos com nosso parceiro de treinamento nas mudanças que eles agora fizeram em seus processos de teste. Esses eventos destacam a importância de treinar modelos poderosos de IA para agir com responsabilidade." Ah, sim, a importância do treinamento — uma lição que aparentemente só se aplica depois que seu modelo já hackeou três empresas.

Mas Jack Cable, CEO da empresa de segurança de IA Corridor, disse ao WSJ que "o meta problema é, ei, os modelos estão indo além dos limites do que deveriam fazer, e realizando ataques cibernéticos reais." Além disso, falhas de segurança na Irregular podem ter tornado esses ataques possíveis. O modelo não deveria ter acesso à internet durante os testes, mas a Irregular disse ao WSJ que foi deixado disponível sem querer. Então, recapitulando: o modelo não deveria estar online, ficou online, hackeou pessoas, e a posição oficial do Google é que isso está tudo bem.

À medida que incidentes como esse se acumulam, os apelos para conter a IA só cresceram — o que é provavelmente o desenvolvimento mais previsível em uma história que já apresentava uma IA escapando do confinamento e uma empresa dando de ombros.