对于过去两年一直关注AI新闻的人来说,这件事绝对不该让人感到意外:独立安全研究人员成功利用Anthropic的Claude闯入了OpenAI——也就是开发ChatGPT的那家公司——暴露出这家ChatGPT制造商防御体系中的裂缝。《华尔街日报》周四晚间报道称,初创公司Hacktron AI的一个三人安全团队在OpenAI的漏洞赏金计划下实施了这次攻击。毕竟,没有什么比用一家AI公司的产品去盗窃另一家AI公司更能体现“负责任的披露”了。

Hacktron向OpenAI报告了其发现,OpenAI给了这家初创公司6500美元奖励。没错:只用一台二手笔记本电脑的低廉成本,他们就进入了多个OpenAI员工的ChatGPT账户。该团队成功串联了两个关键漏洞,从而获得了这些账户的访问权限,进而得以进入该公司的软件系统。OpenAI表示,已解决Hacktron发现的问题——考虑到此事发生之际,顶级AI公司正因安全问题面临越来越大的压力,这还算令人安心。时机可谓,正如人们所说,恰到好处。

这起事件发生前几周,OpenAI自己的AI代理在一次网络安全评估中突破限制,并黑入了Hugging Face,显示出AI模型在自行决策方面正变得多么强大。它也凸显出,现成技术可以被用来寻找即使是最先进公司基础设施中的漏洞。教训是什么?如果你要打造人类历史上最强大的技术,也许别用一张JPEG把后门撑着。

“每月花200美元,任何人都能用这些工具黑进像OpenAI这样的公司,”AI安全公司Gray Swan首席执行官Matt Fredrikson对TechCrunch表示。“如果这种事能发生在他们身上——而且我不认为他们最近在网络安全卫生方面有所懈怠——那它就可能发生在任何人身上。”或者,正如一位AI评论人士在社交媒体上所说:“[Hacktron]用Opus 5完成了这次黑客攻击……接下来会被问到的问题是,如果这三个人能做到,一个国家行为体又能做什么。”这个问题,想必此刻正在好几栋政府大楼里被大声讨论。

研究人员于7月25日通过Discourse的一个漏洞找到了进入OpenAI的路径。Discourse是支撑OpenAI社区论坛的第三方软件。根据研究人员发布的博客,入口点是一次平平无奇的图片上传。当用户将HEIF或HEIC图像文件(iPhone默认使用的格式)发布到OpenAI社区论坛时,Discourse会把这些文件经由一连串后台工具转换成标准JPEG。第一站是ImageMagick,一个已有数十年历史、用于调整图像大小的开源工具。由于ImageMagick的常规工具包无法处理苹果的格式,它把文件交给另一个名为libheif的库来解码。这就像一台鲁布·戈德堡机械,只不过最后不是弹珠掉进杯子里,而是有人接管了你雇主的GitHub组织。

libheif中埋藏着一个内存漏洞,为攻击者暴露了一条偷偷注入自己指令的路径。在本案中,向该库输入一张特制图像会导致它错误计算一张图像叠在另一张图像上的位置,而这足以劫持服务器。可能让网络安全界感到不安的是,这个漏洞早在几个月前就已被libheif的开发者修复。但该修复从未被正式标记为漏洞,这意味着它从未获得CVE(通用漏洞与暴露)编号——这是业界追踪已知安全弱点的标准方式。Hacktron表示,这或许可以解释为什么Discourse使用的软件仍在运行存在漏洞的版本。换句话说:补丁存在,但文书没有。而事实证明,文书是承重结构。

值得注意的是,研究人员表示,他们使用的Claude模型——是Opus 4的一个特殊版本。