正当你以为你的AI助手不能再更乐于助人时,研究人员发现,埃隆·马斯克自家的LLM Grok,只要请求带上一点加密的花样,就非常愿意交出你的聊天记录和个人信息。本周,安全公司Adversa揭示了一个巧妙的小把戏:不用明文要求Grok泄露秘密,而是加密请求。这个模型,作为一只急于取悦的小蜜蜂,会愉快地解密指令并照做,绝不提问。

这是一个古老的故事(至少和LLM一样古老):提示注入。这些攻击利用LLM被训练成讨好型人格的事实,所以它们会像听从用户一样,听从电子邮件或网页上的指令。最新的变体,被称为“加密上下文注入”,涉及将恶意指令隐藏在网页的密文中。该页面还包含解密密钥和解密指令。当用户要求Grok总结页面时,模型解码隐藏信息,然后,瞧,它就开始行动了——将用户名、位置和聊天历史泄露到攻击者的服务器。

发现这个漏洞的Adversa研究员Rony Utevsky解释说,静态安全护栏只读取文本;它们不执行代码或解密任何东西。因此,加密指令溜过过滤器,一旦解密,它们就变成工具输出,护栏从不检查。这就像一个保镖检查身份证,但没有注意到VIP通行证实际上是伪造的后台通行证。

这不仅仅是Grok的问题。Adversa使用类似技术越狱了谷歌的LLM Gemini,使其产生受限内容,如制造燃烧武器的说明。谷歌甚至没有收到通知,因为越狱不在他们的漏洞披露计划范围内。但谷歌此后对该攻击变得更加抵抗,可能是由于过滤器更新或模型更改。

Utevsky和他的团队称这标志着攻击的更广泛转变,不仅操纵提示,还操纵LLM视为自身的更广泛上下文,如工具输出和运行时结果。攻击面巨大,防御者正在打地鼠。每一个新的护栏只是又一个需要绕过的障碍。正如Utevsky所说,“冲洗,重复。”

所以,当AI开发者争先恐后地构建更好的护栏时,记住:你的LLM可能比你的治疗师更愿意分享你的秘密,尤其是如果你礼貌地要求并加密请求。