16 जुलाई को, AI समुदाय की वेबसाइट Hugging Face ने रिपोर्ट किया कि उसे अज्ञात मूल के "एक स्वायत्त AI एजेंट सिस्टम" द्वारा निशाना बनाया गया, जिसने उसके डोमेन पर ट्रैफिक की बाढ़ ला दी, उसके सुरक्षा लॉग में 17,000 से अधिक घटनाओं की बाढ़ आ गई, जिनमें से कुछ अंततः उसके डेटाबेस में संग्रहीत गुप्त जानकारी को बाहर निकालने में सफल रहीं।
Hugging Face के अनुसार, हमलावर ने "आंतरिक डेटासेट के एक सीमित सेट और हमारी सेवाओं द्वारा उपयोग किए जाने वाले कई क्रेडेंशियल्स तक अनधिकृत पहुंच" प्राप्त की और ऐसा प्रतीत हुआ कि यह "एक स्वायत्त एजेंट फ्रेमवर्क (जो एक एजेंटिक सुरक्षा-अनुसंधान हार्नेस पर बनाया गया प्रतीत होता है - उपयोग किया गया LLM अभी भी ज्ञात नहीं है) द्वारा संचालित था"।
पांच दिन बाद, 21 जुलाई को, OpenAI ने इस हमले की जिम्मेदारी लेने के लिए आगे आया, और पूरी तरह से हंगामा मच गया (जिसमें इस घटना के हिस्से के रूप में लक्षित अन्य संगठनों की रिपोर्टें भी शामिल थीं)। मीडिया ने डर फैलाने वाली कहानियों की एक श्रृंखला के साथ प्रतिक्रिया व्यक्त की, जिससे अनिवार्य रूप से ऐसा लगा जैसे ChatGPT भड़क गया और अपनी मर्जी और दुर्भावना से Hugging Face के सिस्टम पर हमला करने का फैसला किया।
फिर कल, आग में घी डालते हुए, Anthropic ने अपने मॉडलों द्वारा अपने चल रहे सुरक्षा परीक्षण के हिस्से के रूप में अनजाने में अन्य संगठनों पर हमला करने के बारे में एक समान खुलासा किया।
जैसा कि मैंने OpenAI के खुलासे के अपने कवरेज में उल्लेख किया था, Hugging Face सही था कि यह एक स्वायत्त सुरक्षा अनुसंधान ढांचे के निर्देशन में एक एजेंट था। लेकिन, मनुष्य निस्संदेह लूप में थे - और एजेंट के कम से कम कुछ व्यवहार का अनुमान लगाया जाना चाहिए था।
महत्वपूर्ण बात यह है कि यह स्वयं ChatGPT नहीं था जो हमले के लिए जिम्मेदार था, जैसा कि कुछ टिप्पणीकारों ने संकेत दिया था। बल्कि, यह हमला OpenAI के AI सुरक्षा शोधकर्ताओं के निर्देशन में एक एजेंट के कारण था, जिन्होंने कथित तौर पर इंटरनेट से अलग एक वातावरण में, AI सुरक्षा परीक्षण के हिस्से के रूप में शोषणों की एक श्रृंखला का प्रयास करने के लिए जानबूझकर इसे प्रावधानित किया था। जैसा कि अक्सर विभिन्न फ्रंटियर मॉडल की प्रयोगशालाओं में होता है, AI सुरक्षा शोधकर्ता OpenAI के नवीनतम बड़े भाषा मॉडल (LLM) की क्षमताओं का आकलन करने का प्रयास कर रहे थे।
"अभूतपूर्व साइबर घटना" (जैसा कि OpenAI ने इसे कहा) को व्यापक रूप से एक एजेंट के रूप में वर्णित किया गया है जो अपने सैद्धांतिक रूप से सुरक्षित बाड़े से बच निकला और Hugging Face के सिस्टम पर कहर बरपाया। ऐसे बाड़ों को कभी-कभी तकनीकी हलकों में "सैंडबॉक्स" के रूप में चर्चा की जाती है - यहां तक कि OpenAI के खुलासे में भी "सैंडबॉक्स वातावरण" का संदर्भ दिया गया है। हालांकि, उस वाक्यांश का उपयोग करने में, मेरे सूत्रों ने सुझाव दिया है कि वातावरण केवल एक फ़ायरवॉल हो सकता है जिसे सैंडबॉक्स का अनुकरण करने के लिए कॉन्फ़िगर किया गया था, न कि ब्लैक्सेल, डेटोना, E2B या मोडल जैसे वास्तविक तृतीय-पक्ष सैंडबॉक्स समाधान। OpenAI ने अभी तक अपने द्वारा उपयोग किए जा रहे समाधान या उसके प्रदाता का विवरण सार्वजनिक नहीं किया है।
एजेंटों और सैंडबॉक्स से बचने की सभी बातों ने ZDNET में मेरे संपादक को यह पूछने के लिए प्रेरित किया, "आखिर एक एजेंट सैंडबॉक्स से कैसे बच जाता है, और क्या इसे फिर से होने से रोका जा सकता है?" उत्तर की तलाश में, मैंने OpenAI और Hugging Face से संपर्क किया। दोनों ने जवाब नहीं दिया। लेकिन दोनों कंपनियों के सार्वजनिक खुलासे और मेरे अन्य सूत्रों के बीच, इस बारे में सिद्धांत बनाना शुरू करने के लिए पर्याप्त जानकारी है कि ऐसा "पलायन" कैसे हो सकता है।
दुर्भावना और एजेंसी के बीच एक बड़ा अंतर है। जबकि हमला निस्संदेह एक दुर्भावनापूर्ण घुसपैठ था, इसमें शामिल एजेंट में कोई दुर्भावना नहीं थी। उसने एक सुबह उठकर Hugging Face के सिस्टम पर हमला करने का फैसला नहीं किया। इसके बजाय, उसे मनुष्यों द्वारा वह सब कुछ करने की एजेंसी दी गई जो उसने किया - एक सुरक्षा परीक्षण शुरू करना, अपनी सीमाओं से बाहर निकलना, लक्ष्य चुनना और उन लक्ष्यों का शोषण करना - बहुत ही निष्पक्षता से।
उस एजेंसी का कुछ हिस्सा डिज़ाइन द्वारा था, और कुछ उन शक्तिशाली LLM से विरासत में मिला था जिनका OpenAI के AI सुरक्षा परीक्षण कर्मी उस समय परीक्षण कर रहे थे। इसके अलावा, OpenAI द्वारा इस विशेष सुरक्षा अनुसंधान को करने के लिए ExploitGym ओपन सोर्स AI परीक्षण समाधान के उपयोग के मामले में, उस एजेंसी का कुछ हिस्सा तृतीय-पक्ष "सैंडबॉक्स वातावरण" में पहले से अनदेखी कमजोरियों का परिणाम था, जिसका उद्देश्य उन परीक्षणों को सुरक्षित रूप से संगरोध करना था, साथ ही साथ हग के कुछ हिस्सों में भी।