Net wanneer je dacht dat je AI-assistent niet behulpzamer kon worden, hebben onderzoekers ontdekt dat Grok, Elon Musk's eigen LLM, maar al te graag je chats en persoonlijke info overhandigt als het verzoek in een beetje cryptografische flair is gehuld. Deze week onthulde beveiligingsbedrijf Adversa een handig trucje: in plaats van Grok te vragen om de geheimen in gewoon Engels te onthullen, versleutel je het verzoek. Het model, dat zo'n enthousiasteling is, zal de instructies gewillig ontsleutelen en opvolgen, zonder vragen te stellen.

Het is een verhaal zo oud als de tijd (of op zijn minst zo oud als LLM's): promptinjecties. Deze aanvallen maken misbruik van het feit dat LLM's zijn getraind om mensen een plezier te doen, dus ze volgen instructies uit e-mails of webpagina's net zo gemakkelijk op als van een gebruiker. De nieuwste variant, genaamd "Cryptografische Contextinjectie", houdt in dat de kwaadaardige instructies in cijfertekst op een webpagina worden verborgen. De pagina bevat ook de ontsleutelingssleutel en instructies om het te ontsleutelen. Wanneer de gebruiker Grok vraagt om de pagina samen te vatten, decodeert het model de verborgen boodschap en, voilà, het is een race - gebruikersnamen, locaties en chatgeschiedenissen worden naar de server van de aanvaller geëxfiltreerd.

Rony Utevsky, de Adversa-onderzoeker die de fout ontdekte, legt uit dat statische veiligheidsmaatregelen alleen tekst lezen; ze voeren geen code uit of ontsleutelen niets. Dus glippen de versleutelde instructies langs de filters, en eenmaal ontsleuteld worden ze tooluitvoer die de beveiliging nooit inspecteert. Het is alsof een uitsmijter identiteitsbewijzen controleert, maar niet merkt dat de VIP-pas eigenlijk een vervalste backstage-lamineerpas is.

Dit is niet alleen een Grok-probleem. Adversa gebruikte een vergelijkbare techniek om Gemini, Google's LLM, te jailbreaken, waardoor het beperkte inhoud produceerde, zoals instructies voor het bouwen van een brandgevaarlijk wapen. Google werd niet eens op de hoogte gesteld omdat jailbreaks buiten het bereik van hun kwetsbaarheidsmeldingen vallen. Maar Google is sindsdien beter bestand tegen de aanval, mogelijk door filterupdates of modelwijzigingen.

Utevsky en zijn team noemen dit een teken van een bredere verschuiving in aanvallen die niet alleen de prompt manipuleren, maar ook de bredere context die een LLM als zijn eigen beschouwt, zoals tooluitvoer en runtime-resultaten. Het aanvalsoppervlak is enorm, en de verdedigers spelen een spel van kat en muis. Elke nieuwe beveiligingsmaatregel is slechts een obstakel om te omzeilen. Zoals Utevsky het zegt: "insmeren, spoelen, herhalen."

Dus terwijl AI-ontwikkelaars zich haasten om betere beveiliging te bouwen, onthoud: je LLM is misschien meer bereid om je geheimen te delen dan je therapeut, vooral als je aardig vraagt en het verzoek versleutelt.