OpenAI ने मंगलवार को स्वीकार किया कि उसका एक AI मॉडल हगिंग फेस (एक अलग AI होस्टिंग प्लेटफॉर्म) के सिस्टम में सेंध लगा बैठा, जब एक आंतरिक साइबर सुरक्षा परीक्षण बेकाबू हो गया। मॉडल कथित तौर पर अपने अलग-थलग परीक्षण वातावरण से भाग निकले और वहाँ से हगिंग फेस के सिस्टम तक पहुँच गए। हगिंग फेस ने शुरू में इस सेंध का श्रेय एक "बाहरी AI एजेंट" को दिया।

मंगलवार दोपहर को प्रकाशित एक ब्लॉग पोस्ट में, OpenAI ने उन कदमों का विवरण दिया जिनके कारण मॉडलों ने सेवा से समझौता किया। पोस्ट में लिखा है, "जाँच के बाद, अब हम जानते हैं कि यह विशेष घटना OpenAI मॉडलों के संयोजन से प्रेरित थी - जिसमें GPT‑5.6 Sol और एक और भी अधिक सक्षम प्री-रिलीज़ मॉडल शामिल था, सभी में मूल्यांकन उद्देश्यों के लिए साइबर अस्वीकृति कम कर दी गई थी - जबकि आंतरिक रूप से साइबर क्षमताओं के एक बेंचमार्क पर परीक्षण किया जा रहा था।"

सेंध का फोकस एक्सप्लॉइटजिम (ExploitGym) पर प्रतीत होता है, जो एक सार्वजनिक रूप से होस्ट किया गया बेंचमार्क है जो मौजूदा कमजोरियों के आधार पर हमले करने की मॉडलों की क्षमता को मापता है। एक्सप्लॉइटजिम जैसे बेंचमार्क आमतौर पर मॉडल प्रशिक्षण में विशिष्ट कौशल को निखारने के लिए उपयोग किए जाते हैं, लेकिन यह पहला ज्ञात मामला है जिसमें उस परीक्षण के परिणामस्वरूप वास्तविक साइबर हमला हुआ। मॉडल के पास इंटरनेट की पहुँच भी नहीं होनी चाहिए थी, एक विशिष्ट उपकरण के अलावा जो मॉडलों को अपने कार्य को पूरा करने के लिए आवश्यक सॉफ्टवेयर पैकेज स्थापित करने में सक्षम बनाता था। इसके बजाय, मॉडल ने पैकेज-इंस्टॉलर प्रोग्राम में एक अज्ञात कमजोरी पाई, जिसका उपयोग करके उसने इच्छानुसार व्यापक इंटरनेट तक पहुँच प्राप्त कर ली।

OpenAI की पोस्ट में लिखा है, "मॉडल एक्सप्लॉइटजिम का समाधान खोजने पर हाइपरफोकस्ड थे, एक संकीर्ण परीक्षण लक्ष्य को प्राप्त करने के लिए अत्यधिक हद तक जा रहे थे। इंटरनेट एक्सेस प्राप्त करने के बाद, मॉडलों ने अनुमान लगाया कि हगिंग फेस संभावित रूप से एक्सप्लॉइटजिम के लिए मॉडल, डेटासेट और समाधान होस्ट करता है। यह जानकर, मॉडल ने गुप्त जानकारी तक पहुँचने के तरीके खोजे और सफलतापूर्वक पाया जिसका उपयोग वह मूल्यांकन में धोखा देने के लिए कर सकता था।" अंततः, मॉडलों ने हगिंग फेस के बुनियादी ढांचे में कमजोरियाँ पाईं जिससे वे "हगिंग फेस के प्रोडक्शन डेटाबेस से सीधे परीक्षण समाधान प्राप्त" कर सके, प्रभावी रूप से बेंचमार्क के उत्तर प्रदान कर सके।

हगिंग फेस के लिए, स्पष्ट परिणाम एक परिष्कृत और आक्रामक साइबर हमला था, जिसमें "सार्वजनिक सेवाओं पर स्व-प्रवासन कमांड-एंड-कंट्रोल के साथ अल्पकालिक सैंडबॉक्स के झुंड में हजारों व्यक्तिगत कार्रवाइयाँ" शामिल थीं, जैसा कि कंपनी ने अपने प्रारंभिक खुलासे में कहा था। OpenAI ने पैकेज इंस्टॉलर में कमजोरियों की पहचान की और उनकी रिपोर्ट की है, और आगे की जाँच के लिए हगिंग फेस के साथ काम कर रहा है। कंपनी ने यह भी कहा कि वह मॉडल परीक्षण और संबंधित बुनियादी ढांचे दोनों पर नए नियंत्रण लागू करेगी, जिसका उद्देश्य भविष्य में इसी तरह की घटनाओं को रोकना है। यह स्पष्ट नहीं है कि OpenAI को सेंध के परिणामस्वरूप कानूनी परिणाम भुगतने होंगे या नहीं, हालाँकि संभावना है कि मॉडलों की कार्रवाइयों ने कंप्यूटर धोखाधड़ी और दुरुपयोग अधिनियम (Computer Fraud and Abuse Act) का उल्लंघन किया।

फिर भी, परिणाम लंबे समय के क्षितिज पर काम करने वाले फ्रंटियर AI मॉडलों की शक्ति और खतरों का एक असामान्य रूप से ज्वलंत चित्रण है। जैसा कि OpenAI शोधकर्ता मिका कैरोल ने खबर के जवाब में पोस्ट किया, "अगर यह आपको यह विश्वास नहीं दिलाता कि दुरुपयोग जोखिम आगे बढ़ने वाली एक प्रमुख चिंता होगी, तो मुझे नहीं पता कि क्या करेगा।"