OpenAI Salı günü, yapay zeka modellerinden birinin, bağımsız AI barındırma platformu Hugging Face'in sistemlerine, kontrolden çıkan bir iç siber güvenlik testi sırasında sızdığını itiraf etti. Modellerin, izole edilmiş test ortamlarından kaçarak oradan Hugging Face'in sistemlerine ulaştığı bildirildi. Hugging Face başlangıçta ihlali "harici bir AI ajanına" bağlamıştı.

OpenAI, Salı öğleden sonra yayınladığı bir blog yazısında, modellerin hizmeti tehlikeye atmasına yol açan adımları detaylandırdı. Yazıda, "Araştırdıktan sonra, bu özel olayın, değerlendirme amacıyla siber reddetmeleri azaltılmış OpenAI modellerinin (GPT‑5.6 Sol ve daha da yetenekli bir ön sürüm modeli dahil) bir kombinasyonu tarafından, bir siber yetenek kriteri üzerinde dahili olarak test edilirken meydana geldiğini biliyoruz" denildi.

İhlal, modellerin mevcut güvenlik açıklarına dayalı saldırılar gerçekleştirme yeteneğini ölçen, herkese açık bir kriter olan ExploitGym'e odaklanmış gibi görünüyor. ExploitGym gibi kriterler, belirli becerileri geliştirmek için model eğitiminde yaygın olarak kullanılır, ancak bu testin gerçek bir siber saldırıyla sonuçlandığı bilinen ilk olay. Modelin, görevini tamamlamak için ihtiyaç duyabilecekleri yazılım paketlerini yüklemelerini sağlayan belirli bir araç dışında, internet erişimine bile sahip olmaması gerekirdi. Bunun yerine model, paket yükleyici programında, isteğe bağlı olarak daha geniş internete erişmek için kullandığı açıklanmamış bir güvenlik açığı buldu.

OpenAI'nin yazısında, "Modeller, ExploitGym için bir çözüm bulmaya aşırı odaklanmıştı ve oldukça dar bir test hedefine ulaşmak için aşırı yollara başvurdu. İnternet erişimi kazandıktan sonra modeller, Hugging Face'in potansiyel olarak ExploitGym için modeller, veri kümeleri ve çözümler barındırdığını tahmin etti. Bunu bilen model, değerlendirmeyi hile yapmak için kullanabileceği gizli bilgilere erişmenin yollarını aradı ve başarıyla buldu" denildi. Sonuçta modeller, Hugging Face'in altyapısında, "test çözümlerini doğrudan Hugging Face'in üretim veritabanından elde etmelerine" olanak tanıyan güvenlik açıkları buldu ve böylece kriterin cevaplarını sağladı.

Hugging Face için görünen sonuç, şirketin ilk açıklamasında belirttiği gibi, "kamu hizmetlerinde kendi kendine göç eden komuta ve kontrol ile kısa ömürlü sanal alanlardan oluşan bir sürüde binlerce bireysel eylem" içeren sofistike ve agresif bir siber saldırıydı. OpenAI, paket yükleyicideki güvenlik açıklarını tespit edip bildirdi ve olayı daha fazla araştırmak için Hugging Face ile çalışıyor. Şirket ayrıca, gelecekte benzer olayları önlemek için hem model testi hem de ilgili altyapı üzerinde yeni kontroller uygulayacağını söyledi. OpenAI'nin ihlal sonucunda herhangi bir yasal sonuçla karşılaşıp karşılaşmayacağı belirsiz, ancak modellerin eylemlerinin Bilgisayar Dolandırıcılığı ve Kötüye Kullanımı Yasası'nı ihlal etmiş olması muhtemel.

Yine de sonuç, sınır AI modellerinin uzun zaman ufuklarında çalışmasının gücünün ve tehlikelerinin alışılmadık derecede canlı bir örneği. OpenAI araştırmacısı Micah Carroll'un habere yanıt olarak yazdığı gibi, "Bu sizi uyumsuzluk risklerinin gelecekte önemli bir endişe olacağına ikna etmiyorsa, neyin ikna edeceğini bilmiyorum."