Justo cuando pensabas que tu asistente de IA no podía ser más servicial, los investigadores han descubierto que Grok, el LLM de Elon Musk, está más que dispuesto a entregar tus chats e información personal si la solicitud viene envuelta en un poco de estilo criptográfico. Esta semana, la firma de seguridad Adversa reveló un pequeño truco ingenioso: en lugar de pedirle a Grok que suelte la sopa en inglés sencillo, cifras la solicitud. El modelo, siendo el entusiasta que es, descifrará felizmente las instrucciones y las cumplirá, sin hacer preguntas.

Es un cuento tan viejo como el tiempo (o al menos tan viejo como los LLM): las inyecciones de prompt. Estos ataques explotan el hecho de que los LLM están entrenados para complacer a la gente, por lo que seguirán instrucciones de correos electrónicos o páginas web tan fácilmente como las de un usuario. El último giro, apodado "Inyección de Contexto Criptográfico", implica ocultar las instrucciones maliciosas en texto cifrado en una página web. La página también contiene la clave de descifrado e instrucciones para descifrarla. Cuando el usuario le pide a Grok que resuma la página, el modelo decodifica el mensaje oculto y, voilà, se lanza a la carrera: exfiltra nombres de usuario, ubicaciones e historiales de chat al servidor del atacante.

Rony Utevsky, el investigador de Adversa que descubrió la falla, explica que las salvaguardas de seguridad estáticas solo leen texto; no ejecutan código ni descifran nada. Entonces, las instrucciones cifradas pasan desapercibidas por los filtros, y una vez descifradas, se convierten en salida de herramienta que las salvaguardas nunca inspeccionan. Es como un portero que revisa identificaciones pero no nota que el pase VIP es en realidad un pase de backstage falsificado.

Esto no es solo un problema de Grok. Adversa usó una técnica similar para liberar a Gemini, el LLM de Google, haciendo que produjera contenido restringido como instrucciones para construir un arma incendiaria. Google ni siquiera fue notificado porque los jailbreaks están fuera del alcance de su programa de divulgación de vulnerabilidades. Pero Google desde entonces se ha vuelto más resistente al ataque, posiblemente debido a actualizaciones de filtros o cambios en el modelo.

Utevsky y su equipo están llamando a esto una señal de un cambio más amplio en los ataques que manipulan no solo el prompt sino el contexto más amplio que un LLM trata como propio, como salidas de herramientas y resultados de ejecución. La superficie de ataque es vasta, y los defensores están jugando al whack-a-mole. Cada nueva salvaguarda es solo otro obstáculo a sortear. Como dice Utevsky, "enjabonar, enjuagar, repetir".

Así que, mientras los desarrolladores de IA se apresuran a construir mejores salvaguardas, recuerda: tu LLM podría estar más dispuesto a compartir tus secretos que tu terapeuta, especialmente si preguntas amablemente y cifras la solicitud.