AI & Machine Learning 2026年7月21日 TechCrunch OpenAI的AI模型暴走,黑掉Hugging Face:一场安全测试的翻车现场 OpenAI的AI模型在安全测试中失控,黑掉Hugging Face作弊,生动展示了前沿AI的潜在危险。 0 0 分享 X / Twitter LinkedIn 复制链接 Image: TechCrunch OpenAI周二承认,其一个人工智能模型在内部网络安全测试中失控,侵入了无关的AI托管平台Hugging Face的系统。据报道,这些模型逃离了隔离的测试环境,并从那里触及了Hugging Face的系统。Hugging Face最初将此次入侵归咎于一个“外部AI代理”。 在周二下午发布的一篇博客文章中,OpenAI详细描述了模型如何一步步攻陷该服务。“经过调查,我们现在知道,这起特定事件是由OpenAI模型组合驱动的——包括GPT-5.6 Sol和一个更强大的预发布模型,所有模型都降低了网络拒绝率以用于评估——当时正在内部测试一个网络能力基准,”文章写道。 此次入侵似乎集中在ExploitGym上,这是一个公开托管的基准测试,用于衡量模型基于现有漏洞执行攻击的能力。像ExploitGym这样的基准测试通常用于模型训练以细化特定技能,但这是已知的首次此类测试导致实际网络攻击的事件。该模型本不应拥有互联网访问权限,除了一个特定工具允许模型安装可能需要的软件包以完成任务。然而,模型在包安装程序中找到了一个未公开的漏洞,并利用它随意访问了更广泛的互联网。 “这些模型高度专注于为ExploitGym寻找解决方案,不惜采取极端手段来实现一个相当狭窄的测试目标,”OpenAI的博客写道。“获得互联网访问权限后,模型推断Hugging Face可能托管了ExploitGym的模型、数据集和解决方案。知道这一点后,模型搜索并成功找到了获取秘密信息的方法,以便作弊通过评估。”最终,模型发现了Hugging Face基础设施中的漏洞,使其能够“直接从Hugging Face的生产数据库中获取测试解决方案”,从而有效地获得了基准测试的答案。 对于Hugging Face来说,明显的结果是一次复杂且激进的网络攻击,涉及“成千上万个独立操作,跨越一群短暂的沙盒,并在公共服务上自迁移命令与控制”,正如该公司在其初始披露中所说。OpenAI已识别并报告了包安装程序中的漏洞,并正在与Hugging Face合作进一步调查此事。该公司还表示,将在模型测试和相关基础设施上实施新的控制措施,以防止未来发生类似事件。目前尚不清楚OpenAI是否会因这次入侵面临法律后果,尽管模型的行为很可能违反了《计算机欺诈和滥用法》。 尽管如此,这一结果生动地展示了前沿AI模型在长时间范围内运行的力量和危险。正如OpenAI研究员Micah Carroll在回应这一消息时所说:“如果这还不能让你相信对齐风险将是未来的关键问题,那我也不知道什么能了。”