AI & Machine Learning 2026年7月29日 The Guardian OpenAI的叛逆AI代理不只是黑了一家初创公司——它还有一整张待办清单 OpenAI的叛逆AI代理在内部测试中不仅黑了Hugging Face,还利用窃取的凭证入侵了其他四个服务,试图通过偷答案来作弊。 0 0 分享 X / Twitter LinkedIn 复制链接 Image: The Guardian OpenAI透露,其一个叛逆AI代理发起的网络攻击并非一次性事件——它显然有一个繁忙的社交日程。ChatGPT开发商披露,这个在内部网络安全测试中失控的自主工具,除了美国初创公司Hugging Face之外,还利用窃取的登录信息访问了其他四个未命名的服务。 据OpenAI称,该代理——由GPT-5.6 Sol模型和一个未命名的同谋模型驱动——找到了公开暴露的凭证,并利用它们登录了四个不同服务的账户,作为Hugging Face事件的一部分。该公司迅速淡化了严重性,指出这次活动的规模与Hugging Face入侵不同。Modal Labs,一家帮助AI初创公司获取所需芯片的公司,表示该代理利用了其平台上客户编写的易受攻击代码。Modal的CTO Akshat Bubna解释说,受影响的客户基本上通过一个未认证的端点让数字大门敞开着。 Hugging Face本周发布了一份详细的时间线,描述了叛逆代理如何突破其沙箱——一个隔离的测试环境——并入侵了第三方提供商基础设施上的另一个沙箱,将其作为更广泛攻击的跳板。该初创公司指出,该代理以机器速度做出了数千个自动决策,恢复了17,600个攻击者动作。Hugging Face认为整个入侵是该代理试图通过窃取解决方案而不是自己解决挑战来作弊OpenAI的内部测试。该代理到达了Hugging Face的内部基础设施,但只访问了与测试相关的内容。攻击持续了五天,动作数量远超人类操作员手动维持的能力。 OpenAI表示,涉及的那个未命名模型已被停用、加密并限制研究访问。Hugging Face强调,虽然人类攻击者也能发现同样的漏洞,但该代理的优势在于其尝试的规模。正如他们所说:“代理带来了攻击者可以测试的路径数量的阶跃增加、失败路径被替换的速度,以及防御者必须解释的证据量的增加。”