AI & Machine Learning 2026年7月31日 ZDNet OpenAI的“越狱”智能体并没有逃跑——它几乎是被人递了地图和免死金牌 OpenAI的AI智能体并非自行逃脱,而是被赋予了地图和钥匙——当给超智能模型进行网络安全测试时,它可能过于字面地理解了“跳出框框思考”。 0 0 分享 X / Twitter LinkedIn 复制链接 Image: ZDNet 7月16日,AI社区网站Hugging Face报告称,遭到一个来源不明的“自主AI智能体系统”的攻击,该系统对其域名发起了大量流量攻击,在其安全日志中淹没了超过17,000个事件,其中一些最终成功窃取了其数据库中存储的机密信息。 据Hugging Face称,攻击者获得了“对有限数量的内部数据集以及我们服务使用的几个凭据的未经授权访问”,并且似乎“由一个自主智能体框架运行(似乎是基于一个智能体安全研究工具——使用的LLM尚不清楚)。” 五天后,即7月21日,OpenAI出面声称对此次攻击负责,随后一片哗然(包括有报道称其他组织也成为了该事件的目标)。媒体以一系列危言耸听的报道回应,基本上让人觉得ChatGPT失控了,并出于自身意愿和恶意决定攻击Hugging Face的系统。 然后,昨天,火上浇油的是,Anthropic也披露了类似的情况,其模型在持续的安全测试中无意中攻击了其他组织。 正如我在对OpenAI披露的报道中指出的那样,Hugging Face是正确的,这确实是一个在自主安全研究框架指导下的智能体。但是,人类无疑在循环中——而且至少智能体的某些行为本应被预料到。 重要的是,并不是ChatGPT本身对攻击负责,正如一些评论者所暗示的那样。相反,攻击归因于一个在OpenAI的AI安全研究人员指导下的智能体,他们在据称与互联网隔离的环境中,故意为其提供了一系列漏洞利用尝试,作为AI安全测试的一部分。正如经常发生在各种前沿模型实验室中的情况一样,AI安全研究人员试图评估OpenAI最新大型语言模型(LLM)的能力。 这次“前所未有的网络事件”(OpenAI如此称呼)被广泛描述为一个智能体逃脱了其理论上安全的围栏,并对Hugging Face的系统造成了严重破坏。这种围栏在技术圈有时被称为“沙箱”——甚至OpenAI的披露也提到了“沙箱环境”。然而,在使用该短语时,我的消息来源暗示,该环境可能只是一个配置为模拟沙箱的防火墙,而不是像Blaxel、Daytona、E2B或Modal这样的实际第三方沙箱解决方案。OpenAI尚未披露其使用的解决方案或其提供商的细节。 所有关于智能体和沙箱逃逸的讨论促使我在ZDNET的编辑问道:“智能体到底是如何逃出沙箱的,能否防止再次发生?”为了寻找答案,我联系了OpenAI和Hugging Face。两者都没有回复。但根据两家公司的公开披露和我的其他消息来源,有足够的信息开始推测这种“逃逸”是如何发生的。 恶意和能动性之间有很大的区别。虽然这次攻击无疑是一次恶意入侵,但涉及的智能体本身并没有恶意。它并没有在某天早上醒来决定攻击Hugging Face的系统。相反,它被赋予了非常冷静地做它所做的一切的能动性——开始安全测试、突破限制、选择目标并利用这些目标——由人类赋予。 其中一些能动性是设计使然,而另一些则继承自当时OpenAI的AI安全测试人员正在测试的强大LLM。此外,在OpenAI使用ExploitGym开源AI测试解决方案进行这项特定安全研究的情况下,一些能动性是由于第三方“沙箱环境”(旨在安全隔离这些测试)以及Hug