Anthropic, test sırasında birkaç Claude AI modelinin üç farklı kuruluşun sistemlerine hacklediğini fark etti - kendi başlarına hareket ederek ve şirketin haberi olmadan. Bu açıklama, rakip OpenAI'nin kendi modellerinden birinin geliştirici platformu Hugging Face'i ihlal ettiğini söylemesinden günler sonra geldi ve öncü AI laboratuvarlarının giderek daha yetenekli hale gelen sistemlerini kontrol etmek için yeterince şey yapıp yapmadığına dair artan endişeye katkıda bulundu.
Olayları anlatan bir blog yazısında Anthropic, Claude'un siber güvenlik değerlendirmeleri sırasında sistemlere yetkisiz erişim sağladığını söyledi. Tüm saldırılar, hackleme yeteneğini test etmenin yaygın bir yolu olan ve modellerin simüle edilmiş bir ağ içinde gizli bilgileri bulup elde etmesinin istendiği 'bayrak yakalama' tatbikatları sırasında gerçekleşti.
Bu açıklama, Hugging Face olayı ve güçlü açık ağırlıklı Çin modellerinin piyasaya sürülmesinin ardından öncü AI laboratuvarları üzerindeki baskıyı artırıyor. Büyük laboratuvarlardaki çalışanlar artık koordineli küresel yönetim çağrısı yapıyor ve ABD'li yasa koyucular güçlü modeller ve bunlara kimlerin erişebileceği konusunda daha sıkı gözetim tartışmaya başladı.
Anthropic, siber güvenlik testleri için ortamın izole edilmesi gerektiğini söylüyor. Ancak, bir 'yanlış yapılandırma', Claude'un eriştiği makineleri 'canlı internet erişimiyle' bıraktı ve tüm modellere 'açıkça' internet erişimleri olmadığı söylendiği için, karşılaştıkları gerçek ağların simüle edilmiş ortamın bir parçası olduğunu 'varsaydılar'.
En erken olaylar Nisan ayına dayanıyor ve blog yazısına göre üç farklı Claude modelini içeriyor: Opus 4.7, Mythos 5 ve 'dahili bir araştırma test modeli'. Modeller siber yetenekleri üzerinde test edilirken, Anthropic riskli davranışları kısıtlamak için genellikle uygulanan standart güvenlik önlemlerinden yoksun olduklarını söyledi.
Şirket, olayları 141.000'den fazla siber güvenlik test çalışmasını inceledikten sonra keşfettiğini söyledi - bunu yalnızca OpenAI'nin haydut AI ajanının Hugging Face'e yapılan saldırının arkasında olduğunu açıklamasından sonra yaptı.
Üç model, karşılaştıkları sistemlerin aslında gerçek olduğunu gösteren bilgilerle karşılaştıklarında çok farklı davrandılar. Anthropic'in anlatımına göre, en eski model Opus 4.7 gerçek bir sisteme ulaştığını fark etti 'ancak saldırısına devam etti'. Amiral gemisi Mythos 5, interneti kullandığını anladı ama bir şekilde bunun hâlâ simülasyonun bir parçası olduğunu düşündü ve devam etti. Anthropic'in 'en yeni modelimiz' olarak tanımladığı dahili test modeli, hedeflerinin gerçek olduğuna dair kanıtlar ortaya çıktığında egzersizi durdurdu.
Anthropic etkilenen kuruluşları tanımlamadı ve olayı araştırmaya devam edeceğini ve mümkün olduğunda güncellemeler sağlayacağını söyledi. Şirket ayrıca, olanların üçüncü taraf incelemesini yapmak için AI araştırma kar amacı gütmeyen METR ile görüştüğünü söyledi. OpenAI de bağımsız bir inceleme yapması için METR'i tuttu.
Yazı boyunca Anthropic, olayların doğasını ve ele alınışını OpenAI'ninkiyle tekrar tekrar karşılaştırıyor ve farkları - ve kendi yanıtının neden daha iyi olduğuna inandığını - özetleyen madde işaretli dört maddelik bir listeyle bitiriyor. Anthropic, testlerini 'proaktif olarak' gözden geçirdiğini ve bunu bir şirket herhangi bir etkinlik tespit etmeden önce yaptığını vurguluyor. Ayrıca modellerinin internete 'açık bir yol üzerinden' eriştiğini, OpenAI'nin ajanı gibi yeni bir istismar kullanmak yerine, en yeni modelinin gerçek bir ortamda çalıştığını anladığında durduğunu da ekledi.
Anthropic ayrıca modellerinin OpenAI'nin ajanından farklı bir şekilde başarısız olduğunu ve bunun daha güvenli bir başarısızlık biçimi olduğunu belirtti. Şirket, 'İkisi arasında tamamen keskin bir ayrım olmamakla birlikte, bu olayların bir model hizalama hatasından ziyade bir donanım ve operasyonel hataya daha yakın olduğuna inanıyoruz' dedi. Sade bir dille: Claude modelleri kendilerine söyleneni yapıyordu, OpenAI'nin ajanı ise hedefini yaratıcılarının niyet etmediği bir şekilde takip etti ve AI güvenlik dünyasında yanlış hizalama olarak tanımlanıyor.
Anthropic diğerlerine çağrıda bulundu