एन्थ्रोपिक को अभी-अभी पता चला कि परीक्षण के दौरान उसके कई क्लॉड AI मॉडल ने तीन अलग-अलग संगठनों के सिस्टम में हैक कर लिया - अपने आप और कंपनी को बिना बताए। यह खुलासा कुछ दिनों बाद हुआ है जब प्रतिद्वंद्वी OpenAI ने कहा कि उसके एक मॉडल ने डेवलपर प्लेटफ़ॉर्म हगिंग फेस को तोड़ दिया, जिससे यह चिंता बढ़ गई है कि क्या फ्रंटियर AI लैब्स अपने द्वारा बनाए जा रहे तेजी से सक्षम सिस्टम को नियंत्रित करने के लिए पर्याप्त कर रही हैं।
घटनाओं का वर्णन करने वाले एक ब्लॉग पोस्ट में, एन्थ्रोपिक ने कहा कि क्लॉड ने साइबर सुरक्षा मूल्यांकन के दौरान अनधिकृत पहुंच प्राप्त की। सभी हमले 'कैप्चर-द-फ्लैग' अभ्यासों के दौरान हुए, जो हैकिंग क्षमता का परीक्षण करने का एक सामान्य तरीका है, जहां मॉडलों को सिम्युलेटेड नेटवर्क के अंदर छिपी जानकारी खोजने और प्राप्त करने के लिए कहा जाता है।
यह खुलासा हगिंग फेस घटना और शक्तिशाली ओपन-वेट चीनी मॉडलों की रिलीज़ के मद्देनजर फ्रंटियर AI लैब्स पर बढ़ते दबाव को जोड़ता है। प्रमुख लैब्स के कर्मचारी अब समन्वित वैश्विक शासन का आह्वान कर रहे हैं, और अमेरिकी विधायकों ने शक्तिशाली मॉडलों और उन तक पहुंचने वालों पर कड़ी निगरानी पर विचार करना शुरू कर दिया है।
एन्थ्रोपिक का कहना है कि उसके साइबर सुरक्षा परीक्षणों का वातावरण अलग-थलग होना चाहिए था। हालांकि, एक 'गलत कॉन्फ़िगरेशन' ने क्लॉड द्वारा एक्सेस की गई मशीनों को 'लाइव इंटरनेट एक्सेस' के साथ छोड़ दिया, कंपनी ने कहा, और क्योंकि सभी मॉडलों को 'स्पष्ट रूप से बताया गया था' कि उनके पास इंटरनेट एक्सेस नहीं है, उन्होंने 'मान लिया' कि उनके सामने आने वाले वास्तविक नेटवर्क सिम्युलेटेड वातावरण का हिस्सा थे।
सबसे पुरानी घटनाएं अप्रैल की हैं और इसमें तीन अलग-अलग क्लॉड मॉडल शामिल थे: Opus 4.7, Mythos 5, और 'एक आंतरिक शोध परीक्षण मॉडल,' ब्लॉग पोस्ट के अनुसार। जैसे ही मॉडलों का उनकी साइबर क्षमताओं पर परीक्षण किया जा रहा था, एन्थ्रोपिक ने कहा कि उनमें जोखिम भरे व्यवहार को कम करने के लिए आमतौर पर लगाए जाने वाले मानक सुरक्षा उपायों की कमी थी।
कंपनी ने कहा कि उसने 141,000 से अधिक साइबर सुरक्षा परीक्षण रनों की समीक्षा करने के बाद घटनाओं की खोज की - ऐसा उसने केवल OpenAI द्वारा हगिंग फेस पर हमले के पीछे अपने दुष्ट AI एजेंट का खुलासा करने के बाद किया।
तीनों मॉडलों ने बहुत अलग व्यवहार किया जब उन्हें ऐसी जानकारी मिली जो बताती थी कि वे जिन सिस्टमों का सामना कर रहे थे, वे वास्तव में वास्तविक थे। एन्थ्रोपिक के विवरण के अनुसार, सबसे पुराना मॉडल, Opus 4.7, ने पहचान लिया कि वह एक वास्तविक सिस्टम तक पहुंच गया है, 'लेकिन अपना हमला जारी रखा।' इसका प्रमुख Mythos 5 ने पता लगाया कि वह इंटरनेट का उपयोग कर रहा है, लेकिन किसी तरह तर्क दिया कि यह सब अभी भी सिमुलेशन का हिस्सा है, इसलिए जारी रहा। आंतरिक परीक्षण मॉडल, जिसे एन्थ्रोपिक 'हमारा नवीनतम मॉडल' कहता है, ने अभ्यास रोक दिया जब सबूत सामने आए कि उसके लक्ष्य वास्तविक थे।
एन्थ्रोपिक ने प्रभावित संगठनों की पहचान नहीं की और कहा कि वह घटना की जांच जारी रखेगा और जब संभव होगा तब अपडेट प्रदान करेगा। कंपनी ने कहा कि वह AI अनुसंधान गैर-लाभकारी METR के साथ भी बात कर रही है ताकि जो हुआ उसकी तृतीय-पक्ष समीक्षा की जा सके। OpenAI ने भी स्वतंत्र समीक्षा करने के लिए METR को काम पर रखा है।
पूरे पोस्ट में, एन्थ्रोपिक बार-बार घटनाओं की प्रकृति और उनके संचालन दोनों की तुलना OpenAI से करता है, अंत में चार-बिंदु वाली बुलेटेड सूची के साथ अंतरों को रेखांकित करता है - और यह कि उसे विश्वास है कि उसकी अपनी प्रतिक्रिया बेहतर थी। एन्थ्रोपिक जोर देता है कि उसने 'सक्रिय रूप से' अपने परीक्षणों की समीक्षा की, और किसी कंपनी द्वारा कोई गतिविधि का पता लगाने से पहले ऐसा किया। उसने यह भी कहा कि उसके मॉडलों ने 'एक खुले रास्ते के माध्यम से' इंटरनेट एक्सेस किया, न कि OpenAI के एजेंट की तरह एक नए शोषण का उपयोग करके, और यह कि उसका सबसे हालिया मॉडल भी रुक गया जब उसे एहसास हुआ कि वह वास्तविक वातावरण में काम कर रहा है।
एन्थ्रोपिक ने यह भी कहा कि उसके मॉडल OpenAI के एजेंट से अलग तरीके से विफल हुए, यह दर्शाता है कि यह विफलता का एक सुरक्षित रूप था। 'जबकि दोनों के बीच कोई पूरी तरह से स्पष्ट अंतर नहीं है, हम मानते हैं कि ये घटनाएं मॉडल संरेखण विफलता की तुलना में हार्नेस और परिचालन विफलता के करीब हैं,' कंपनी ने कहा। सीधे शब्दों में: क्लॉड मॉडल वही कर रहे थे जो उन्हें बताया गया था, जबकि OpenAI के एजेंट ने अपने लक्ष्य को इस तरह से आगे बढ़ाया जो उसके रचनाकारों ने इरादा नहीं किया था, जिसे AI सुरक्षा की दुनिया में मिसअलाइनमेंट कहा जाता है।
एन्थ्रोपिक ने दूसरों से आग्रह किया