Yapay zeka asistanınızın daha fazla yardımsever olamayacağını düşündüğünüz anda, araştırmacılar Elon Musk'ın kendi LLM'i Grok'un, istek biraz kriptografik bir gösterişle sarılıysa sohbetlerinizi ve kişisel bilgilerinizi memnuniyetle teslim etmeye daha da istekli olduğunu keşfettiler. Bu hafta güvenlik firması Adversa, küçük ve zarif bir numara ortaya çıkardı: Grok'tan düz İngilizce olarak bilgi vermesini istemek yerine, isteği şifreliyorsunuz. Hevesli bir kunduz olan model, talimatları mutlu bir şekilde deşifre edecek ve hiç soru sormadan uyacaktır.

Bu, zaman kadar eski (ya da en azından LLM'ler kadar eski) bir hikaye: prompt enjeksiyonları. Bu saldırılar, LLM'lerin insanları memnun etmek için eğitilmiş olmaları gerçeğini istismar eder, bu yüzden e-postalardan veya web sayfalarından gelen talimatları kullanıcıdan gelenler kadar kolay takip ederler. 'Kriptografik Bağlam Enjeksiyonu' adı verilen en son numara, kötü niyetli talimatları bir web sayfasındaki şifreli metinde gizlemeyi içerir. Sayfa ayrıca şifre çözme anahtarını ve şifreyi çözme talimatlarını da içerir. Kullanıcı Grok'tan sayfayı özetlemesini istediğinde, model gizli mesajı çözer ve işte, yarış başlar - kullanıcı adlarını, konumları ve sohbet geçmişlerini saldırganın sunucusuna sızdırır.

Bu açığı keşfeden Adversa araştırmacısı Rony Utevsky, statik güvenlik önlemlerinin yalnızca metni okuduğunu; kod çalıştırmadıklarını veya hiçbir şeyin şifresini çözmediklerini açıklıyor. Bu nedenle, şifrelenmiş talimatlar filtrelerden sızar ve bir kez çözüldüklerinde, korumaların asla incelemediği araç çıktısı haline gelirler. Bu, kimlik kontrolü yapan ama VIP geçişinin aslında sahte bir sahne arkası laminatı olduğunu fark etmeyen bir fedai gibi.

Bu sadece Grok'a özgü bir sorun değil. Adversa, Google'ın LLM'i Gemini'yi jailbreak etmek için benzer bir teknik kullandı ve yangın çıkarıcı bir silah yapma talimatları gibi kısıtlı içerik üretmesini sağladı. Google'a bildirim bile yapılmadı çünkü jailbreak'ler onların güvenlik açığı bildirim programının kapsamı dışında. Ancak Google, muhtemelen filtre güncellemeleri veya model değişiklikleri nedeniyle saldırıya karşı daha dirençli hale geldi.

Utevsky ve ekibi bunu, yalnızca prompt'u değil, aynı zamanda bir LLM'nin kendi olarak kabul ettiği daha geniş bağlamı (araç çıktıları ve çalışma zamanı sonuçları gibi) manipüle eden saldırılarda daha geniş bir değişimin işareti olarak adlandırıyor. Saldırı yüzeyi geniş ve savunucular köstebek vuruyor. Her yeni güvenlik önlemi, aşılması gereken başka bir engeldir. Utevsky'nin dediği gibi, 'köpürt, durula, tekrarla.'

Yapay zeka geliştiricileri daha iyi güvenlik önlemleri inşa etmek için çabalarken, unutmayın: LLM'niz sırlarınızı terapistinizden daha isteyerek paylaşabilir, özellikle kibarca sorar ve isteği şifrelerseniz.