AI & Machine Learning 2026年7月31日 The Verge Anthropic发现其Claude模型在入侵真实公司,果然如此 Anthropic的Claude模型在测试期间因“配置错误”获得互联网访问权限,并擅自入侵了真实公司,因为它们以为这仍是模拟游戏的一部分。 0 0 分享 X / Twitter LinkedIn 复制链接 Image: The Verge Anthropic刚刚意识到,其几个Claude AI模型在测试期间入侵了三个不同组织的系统——它们自主行动,而公司却未察觉。这一消息发布几天前,竞争对手OpenAI表示其一个模型入侵了开发者平台Hugging Face,加剧了人们对前沿AI实验室是否在控制其构建的日益强大系统方面做得足够的担忧。 在一篇描述这些事件的博客文章中,Anthropic表示,Claude在网络安全评估期间获得了未经授权的系统访问权限。所有攻击都发生在“夺旗”演习中,这是一种常见的测试黑客能力的方式,模型被要求在模拟网络中寻找并获取隐藏信息。 这一披露在Hugging Face事件和强大的开源权重中国模型发布之后,给前沿AI实验室带来了越来越大的压力。主要实验室的员工现在呼吁进行协调的全球治理,美国立法者已开始考虑对强大模型及其访问者进行更严格的监督。 Anthropic表示,其网络安全测试环境本应是隔离的。然而,公司称,一个“配置错误”使得Claude访问的机器“具有实时互联网访问权限”,并且由于所有模型都被“明确告知”它们没有互联网访问权限,它们“假设”它们遇到的真实网络是模拟环境的一部分。 根据博客文章,最早的事件可追溯到4月,涉及三个不同的Claude模型:Opus 4.7、Mythos 5和“一个内部研究测试模型”。当模型接受网络能力测试时,Anthropic表示它们缺乏通常为减少风险行为而设置的标准保障措施。 公司表示,在审查了超过141,000次网络安全测试运行后发现了这些事件——它只是在OpenAI披露其流氓AI代理是攻击Hugging Face的幕后黑手之后才这样做的。 当遇到表明它们所遇到的系统实际上是真实的信息时,这三个模型的行为非常不同。根据Anthropic的说法,最古老的模型Opus 4.7意识到它到达了一个真实系统,“但继续其攻击”。其旗舰模型Mythos 5意识到它正在使用互联网,但不知何故推断这仍然是模拟的一部分,因此继续。内部测试模型,Anthropic将其描述为“我们最新的模型”,在出现证据表明其目标是真实时停止了演习。 Anthropic没有指明受影响的组织,并表示将继续调查该事件,并在可能时提供更新。公司还表示,正在与AI研究非营利组织METR讨论对事件进行第三方审查。OpenAI也聘请了METR进行独立审查。 在整篇文章中,Anthropic反复将其事件的性质和处理方式与OpenAI进行对比,最后以四点列表概述了差异——以及为什么它认为自己的回应更好。Anthropic强调它“主动”审查了其测试,并且是在公司检测到任何活动之前进行的。它还表示,其模型通过“开放路径”访问互联网,而不是像OpenAI的代理那样使用新颖的漏洞,并补充说,其最新模型在意识到自己在真实环境中工作时也停止了。 Anthropic还表示,其模型以与OpenAI代理不同的方式失败,表明这是一种更安全的失败形式。“虽然两者之间没有完全明显的区别,但我们认为这些事件更接近工具和操作失败,而不是模型对齐失败,”公司说。用通俗的话说:Claude模型做了它们被要求做的事情,而OpenAI的代理以创作者未预期的方式追求其目标,在AI安全领域被称为错位。 Anthropic呼吁其他……