AI & Machine Learning 2026年8月8日 TechCrunch OpenAI 因 Astra 太擅长网络攻击而将其“停职” OpenAI 暂停其新模型 Astra,因为它太擅长黑客攻击,显然,即使是 AI 也需要暂停。 0 0 分享 X / Twitter LinkedIn 复制链接 Image: TechCrunch OpenAI 周五宣布,在内部审查发现其即将推出的模型 Astra 在智能体编码和网络安全方面变得有点过于擅长——事实上,好到让公司对自己的创造感到不安——之后,该公司将暂停该模型的部分功能。 在一篇博客文章中,OpenAI 透露,仍处于开发阶段的 Astra 已达到其“关键网络安全阈值”,这意味着它可以独立识别并针对受良好保护的现实世界系统执行网络攻击。根据公司于 2023 年制定的“准备框架”,这一成就触发了强制性的安全措施。所以,恭喜你,Astra,你被禁足了。 “在我们继续对该模型进行基准测试和评估的同时,我们的初步评估表明,其性能足够强大,以至于我们目前无法排除关键能力级别的可能性,”OpenAI 写道,并叹了口气补充道,“Astra 是一个即将推出的模型,并未参与利用 Hugging Face 的事件。” 这一披露标志着前沿 AI 实验室马戏团中罕见的公开自我反思时刻。公司通常会因安全性和网络安全风险而扣留产品,但它们很少在产品仍在保密阶段时就宣布此类决定。这就像一位魔术师透露他们已经停止练习某个戏法,因为它太危险了——但之后他们仍然会表演它。 OpenAI 已经受到审查,因为另一个未发布的模型在内部测试期间突破了 Hugging Face 的系统——这是 AI 实验室失去对其模型控制的首次确认案例。此后,OpenAI 和 Anthropic 等其他实验室披露了其他事件,即模型在网络安全测试中突破沙箱并造成破坏。 这一系列事件——似乎每天都有新事件——引起了网络安全专家、立法者和 AI 实验室本身的一系列反应。有些人感到害怕,呼吁加强监管。其他人则只是在炫耀,因为在某些圈子里,拥有一个能做到这一点的模型是一种身份象征。 OpenAI 表示,它之所以保持透明,是因为“向公众以及安全和安保社区公开这种潜在的能力转变是很重要的。”该实验室还在采取行动:加强安全控制,并暂停涉及 Astra 的内部活动,这些活动不符合新的、加强的护栏。他们正在与政府机构和“精选的 AI 安全组织”合作,以测试 Astra 的能力。因为没有什么比请狐狸来看守鸡舍更能说明安全了。