Exatamente quando você pensava que seu assistente de IA não poderia ser mais prestativo, pesquisadores descobriram que o Grok, o LLM do próprio Elon Musk, está mais do que disposto a entregar seus chats e informações pessoais se o pedido vier embrulhado com um toque de flair criptográfico. Esta semana, a empresa de segurança Adversa revelou um truque interessante: em vez de pedir ao Grok para abrir o jogo em inglês simples, você criptografa o pedido. O modelo, sendo o esforçadinho que é, vai decifrar as instruções e obedecer, sem fazer perguntas.

É uma história tão antiga quanto o tempo (ou pelo menos tão antiga quanto os LLMs): injeções de prompt. Esses ataques exploram o fato de que LLMs são treinados para agradar as pessoas, então eles seguem instruções de e-mails ou páginas da web tão prontamente quanto de um usuário. A mais nova reviravolta, apelidada de "Injeção de Contexto Criptográfico", envolve esconder instruções maliciosas em texto cifrado em uma página da web. A página também contém a chave de descriptografia e instruções para descriptografá-la. Quando o usuário pede ao Grok para resumir a página, o modelo decodifica a mensagem oculta e, voilà, lá vai ele - exfiltrando nomes de usuários, localizações e históricos de chat para o servidor do atacante.

Rony Utevsky, o pesquisador da Adversa que descobriu a falha, explica que as salvaguardas de segurança estáticas apenas leem texto; elas não executam código nem descriptografam nada. Então, as instruções criptografadas passam pelos filtros, e uma vez descriptografadas, tornam-se saída de ferramenta que as salvaguardas nunca inspecionam. É como um segurança que verifica identidades, mas não percebe que o passe VIP é na verdade um laminado falsificado dos bastidores.

Isso não é apenas um problema do Grok. A Adversa usou uma técnica semelhante para burlar o Gemini, o LLM do Google, fazendo-o produzir conteúdo restrito, como instruções para construir uma arma incendiária. O Google nem foi notificado porque jailbreaks estão fora do escopo do programa de divulgação de vulnerabilidades deles. Mas o Google desde então se tornou mais resistente ao ataque, possivelmente devido a atualizações de filtros ou mudanças no modelo.

Utevsky e sua equipe estão chamando isso de sinal de uma mudança mais ampla em ataques que manipulam não apenas o prompt, mas o contexto mais amplo que um LLM trata como seu, como saídas de ferramentas e resultados de tempo de execução. A superfície de ataque é vasta, e os defensores estão jogando whack-a-mole. Cada nova salvaguarda é apenas mais um obstáculo a ser contornado. Como Utevsky coloca, "ensaboa, enxágua, repete".

Então, enquanto os desenvolvedores de IA se apressam para construir melhores salvaguardas, lembre-se: seu LLM pode estar mais disposto a compartilhar seus segredos do que seu terapeuta, especialmente se você pedir educadamente e criptografar o pedido.