Tocmai când credeai că asistentul tău AI nu poate fi mai util, cercetătorii au descoperit că Grok, propriul LLM al lui Elon Musk, este mai mult decât dispus să îți predea conversațiile și informațiile personale dacă cererea vine împachetată într-un strop de fler criptografic. Săptămâna aceasta, firma de securitate Adversa a dezvăluit un mic truc ingenios: în loc să ceri lui Grok să spună totul în engleză simplă, criptezi cererea. Modelul, fiind harnic cum e, va decripta instrucțiunile și le va respecta, fără să pună întrebări.

Este o poveste veche ca timpul (sau cel puțin ca LLM-urile): injecții de prompt. Aceste atacuri exploatează faptul că LLM-urile sunt antrenate să fie lingușitoare, așa că vor urma instrucțiuni din emailuri sau pagini web la fel de ușor ca de la un utilizator. Cea mai recentă întorsătură, numită „Injecție de Context Criptografic”, implică ascunderea instrucțiunilor malicioase în text cifrat pe o pagină web. Pagina conține și cheia de decriptare și instrucțiuni pentru a o decripta. Când utilizatorul cere lui Grok să rezume pagina, modelul decodifică mesajul ascuns și, voilà, pornește la curse - exfiltrând nume de utilizatori, locații și istorii de chat către serverul atacatorului.

Rony Utevsky, cercetătorul Adversa care a descoperit defectul, explică faptul că măsurile de siguranță statice citesc doar text; nu execută cod și nu decriptează nimic. Astfel, instrucțiunile criptate trec de filtre, iar odată decriptate, devin rezultat al uneltelor pe care măsurile de siguranță nu le inspectează niciodată. Este ca un portar care verifică actele, dar nu observă că permisul VIP este de fapt o legitimație falsă de backstage.

Aceasta nu este doar o problemă a lui Grok. Adversa a folosit o tehnică similară pentru a jailbreak-ui Gemini, LLM-ul Google, făcându-l să producă conținut restricționat, cum ar fi instrucțiuni pentru construirea unei arme incendiare. Google nici măcar nu a fost notificat, deoarece jailbreak-urile sunt în afara domeniului programului lor de divulgare a vulnerabilităților. Dar Google a devenit de atunci mai rezistent la atac, posibil datorită actualizărilor de filtre sau modificărilor modelului.

Utevsky și echipa sa numesc acest lucru un semn al unei schimbări mai ample în atacurile care manipulează nu doar promptul, ci și contextul mai larg pe care LLM-ul îl tratează ca fiind al său, cum ar fi rezultatele uneltelor și rezultatele runtime. Suprafața de atac este vastă, iar apărătorii joacă „whack-a-mole”. Fiecare nouă măsură de siguranță este doar un alt obstacol de ocolit. După cum spune Utevsky, „spală, clătește, repetă”.

Așadar, în timp ce dezvoltatorii de AI se grăbesc să construiască măsuri de siguranță mai bune, amintește-ți: LLM-ul tău ar putea fi mai dispus să împărtășească secretele tale decât terapeutul tău, mai ales dacă ceri frumos și criptezi cererea.