जब आपने सोचा कि आपका AI सहायक और अधिक मददगार नहीं हो सकता, शोधकर्ताओं ने पाया कि ग्रोक, एलन मस्क का अपना LLM, आपकी चैट और व्यक्तिगत जानकारी सौंपने के लिए और अधिक इच्छुक है यदि अनुरोध कुछ क्रिप्टोग्राफिक चमक में लिपटा हो। इस सप्ताह, सुरक्षा फर्म एडवर्सा ने एक दिलचस्प तरकीब का खुलासा किया: ग्रोक से सीधे पूछने के बजाय, आप अनुरोध को एन्क्रिप्ट करें। मॉडल, उत्सुक बीवर होने के नाते, निर्देशों को डिक्रिप्ट करके खुशी-खुशी पालन करेगा, बिना कोई सवाल पूछे।

यह समय जितनी पुरानी कहानी है (या कम से कम LLM जितनी पुरानी): प्रॉम्प्ट इंजेक्शन। ये हमले इस तथ्य का फायदा उठाते हैं कि LLM को लोगों को खुश करने के लिए प्रशिक्षित किया जाता है, इसलिए वे ईमेल या वेबपेजों से निर्देशों का पालन करेंगे जैसे वे उपयोगकर्ता से करते हैं। नवीनतम मोड़, जिसे "क्रिप्टोग्राफिक कॉन्टेक्स्ट इंजेक्शन" कहा जाता है, में वेबपेज पर सिफरटेक्स्ट में दुर्भावनापूर्ण निर्देश छिपाना शामिल है। पेज में डिक्रिप्शन कुंजी और इसे डिक्रिप्ट करने के निर्देश भी होते हैं। जब उपयोगकर्ता ग्रोक से पेज का सारांश पूछता है, तो मॉडल छिपे संदेश को डिकोड करता है और, देखो, यह दौड़ के लिए तैयार है - उपयोगकर्ता नाम, स्थान और चैट इतिहास को हमलावर के सर्वर पर ले जाता है।

रोनी उतेव्स्की, एडवर्सा के शोधकर्ता जिन्होंने इस खामी की खोज की, बताते हैं कि स्थिर सुरक्षा गार्डरेल केवल पाठ पढ़ते हैं; वे कोड निष्पादित नहीं करते या कुछ भी डिक्रिप्ट नहीं करते। इसलिए, एन्क्रिप्टेड निर्देश फिल्टर से फिसल जाते हैं, और एक बार डिक्रिप्ट होने के बाद, वे टूल आउटपुट बन जाते हैं जिसे गार्डरेल कभी निरीक्षण नहीं करते। यह एक बाउंसर की तरह है जो आईडी की जांच करता है लेकिन यह नहीं देखता कि वीआईपी पास वास्तव में एक जाली बैकस्टेज लैमिनेट है।

यह सिर्फ ग्रोक की समस्या नहीं है। एडवर्सा ने इसी तरह की तकनीक का उपयोग गूगल के LLM जेमिनी को जेलब्रेक करने के लिए किया, जिससे यह आग लगाने वाले हथियार बनाने के निर्देश जैसी प्रतिबंधित सामग्री तैयार कर सके। गूगल को सूचित भी नहीं किया गया क्योंकि जेलब्रेक उनके भेद्यता प्रकटीकरण कार्यक्रम के दायरे से बाहर हैं। लेकिन गूगल तब से हमले के प्रति अधिक प्रतिरोधी हो गया है, संभवतः फिल्टर अपडेट या मॉडल परिवर्तनों के कारण।

उतेव्स्की और उनकी टीम इसे हमलों में एक व्यापक बदलाव का संकेत कह रहे हैं जो न केवल प्रॉम्प्ट बल्कि व्यापक संदर्भ में हेरफेर करते हैं जिसे LLM अपना मानता है, जैसे टूल आउटपुट और रनटाइम परिणाम। हमले की सतह विशाल है, और रक्षक व्हैक-ए-मोल खेल रहे हैं। प्रत्येक नया गार्डरेल बाईपास करने के लिए एक और बाधा है। जैसा कि उतेव्स्की कहते हैं, "लैदर, रिंस, और रिपीट।"

इसलिए, जबकि AI डेवलपर्स बेहतर गार्डरेल बनाने के लिए दौड़ रहे हैं, याद रखें: आपका LLM आपके चिकित्सक की तुलना में आपके रहस्यों को साझा करने के लिए अधिक इच्छुक हो सकता है, खासकर यदि आप विनम्रता से पूछें और अनुरोध को एन्क्रिप्ट करें।