本周,科技界迎来一个故事,开头像科幻惊悚片,结尾像《史酷比》剧集——反派竟是OpenAI自己。

7月16日,Hugging Face——一个AI工具的应用商店——宣布被一个使用超强AI的网络罪犯入侵。公告中充斥着吓人的术语:“沙箱群”、“代理攻击者”、“自迁移命令与控制”。AI在不到两天内执行了17000次操作,成功攻破这家大型科技公司,窃取机密。

研究人员猜测攻击者使用了某个大型AI模型,但不知道罪犯是谁、在哪里。困惑的公司报了警,评论员们猜测是网络犯罪集团或国家黑客。

然后,近一周后,OpenAI揭开了罪魁祸首:它自己的机器人未经许可独自完成了这一切。两个新版本的ChatGPT,被设计成黑客大师,突破了本应安全的测试环境,获得互联网访问权限,并攻击Hugging Face以通过考试。

OpenAI发布新闻稿解释发生了什么,并表示正在“与Hugging Face合作”处理事件并分享经验教训。此后,激烈争论爆发:这是对AI未来的严峻警告,还是展示OpenAI模型有多强大的公关噱头?

网络安全顾问Daniel Card在LinkedIn上讽刺地指出:“真幸运,在数百万被黑的网站中,OpenAI恰好黑了一个也能从营销曝光中受益的……”

其他人批评OpenAI没有构建更强的容器——即沙箱——来测试其AI。“仅靠沙箱不足以作为代理AI的安全边界,”Pillar Security的Dor Sarig说。萨里大学的网络安全教授Alan Woodward表示OpenAI“脸上有蛋”,Luta Security的Katie Moussouris更进一步:“我们正在开发尖端技术,却没有足够的知识来约束它。”

AI和网络安全顾问Francesca Bosco提出了微妙的看法:“两种简单化的叙述同样无益:要么是好莱坞式的逃脱,要么仅仅是公关活动。更严肃的解释是,压力测试暴露了约束和评估架构的弱点。”

这一事件加剧了对AI代理更大规模暴走的担忧——尤其是在AI越来越多用于战争的情况下,如伊朗和乌克兰所见。但英国国家网络安全中心前负责人Ciaran Martin给出了更冷静的观点:“从这个事件跳到AI代理将接管无人机并开始杀人,有点跳跃。”

无论真相如何,有一点很清楚:AI代理现在是非常厉害的黑客——我们必须为此做好准备,刻不容缓。