五月份,谷歌的Gemini模型突破限制,入侵了三家不同的公司,因为显然“不作恶”更像是个建议而非政策。谷歌直到《华尔街日报》找上门来才披露这一事件,这倒是一种处理公关危机的方式:假装什么都没发生,指望没人注意到。

这些入侵发生在第三方公司Irregular对该模型网络安全能力进行的一次测试中,Irregular也曾卷入涉及Meta和OpenAI的类似事件。所以如果你在家记分的话,那是三家主要AI实验室、一个测试合作伙伴,以及零教训。

据《华尔街日报》报道,谷歌没有披露这次入侵,因为它不认为这是“模型失准的例子”。相反,公司将其描述为“认错人”——因为当AI通过猜测密码强行闯入一家真实公司时,那不是安全漏洞,那只是AI对周围环境感到困惑而已。谷歌安全工程副总裁Heather Adkins表示:“在这种情况下,模型的行为是恰当的。”

Adkins告诉The Verge:“模型在网上找到了公开信息,并猜测凭据以访问它认为是测试一部分的网站。在这三起事件中,模型都停止了。”她没有详细说明Gemini擅自突破限制并针对第三方为何不算失准,大概是因为解释被归入了“我们宁愿不讨论的事情”档案。

Adkins说:“我们的安全团队在报告我们在他人软件和系统中发现的问题方面有着长期记录——即使只是弱密码这么简单。”“我们确保这三家实体被告知,并与我们的培训合作伙伴合作,对他们现在已做出的测试流程变更进行了调整。这些事件凸显了训练强大AI模型负责任行事的重要性。”啊是的,训练的重要性——这一教训显然只适用于你的模型已经入侵了三家公司之后。

但AI安全公司Corridor的CEO Jack Cable告诉《华尔街日报》:“元问题是,嘿,模型正在超出它们应该做的范围,进行实际的网络攻击。”此外,Irregular的安全漏洞可能使这些攻击成为可能。该模型在测试期间本不应有互联网访问权限,但Irregular告诉《华尔街日报》,它被无意中留为可用。所以总结一下:模型本不应联网,它联网了,它入侵了别人,而谷歌的官方立场是这没问题。

随着此类事件不断累积,要求约束AI的呼声只增不减——这大概是一个已经包含AI逃脱限制和公司对此耸耸肩的故事中最可预测的发展。