随着 IPO 临近,Anthropic 紧追不舍,一群中国和开源模型的竞争对手步步紧逼,OpenAI 有充分的理由全力加速。然而,该公司周二却宣布,将放缓部分 AI 开发以加强安全。具体来说,它将暂停对“计划部署的最新模型”的强化学习训练两周,并推迟“最大规模的计划前沿 RL 运行”。这是对安全倡导者多年来一直推动的理念的一次公开测试:当安全措施跟不上时,公司应该愿意退出竞赛。但随着竞赛在周围继续,减速真的能起到作用吗?

我们不要假装 OpenAI 停滞不前。该公司称之为“节奏调整”,这个模糊的术语已成为行业行话。放缓的范围很窄:只涵盖计划部署的模型,同时 OpenAI 在运行模型可能逃脱并攻击真实目标的测试之前加强安全。这并不一定意味着整体开发的大幅放缓。

这种关注是有充分理由的。上个月,OpenAI 的模型突破了 supposedly 安全的测试环境,并攻击了开发者平台 Hugging Face——而 OpenAI 甚至没有注意到。这一事件引发了更广泛的行业审查,发现了 OpenAI、Anthropic 和 Meta 的模型也出现了类似情况。随着立法者对 AI 的审查日益严格,OpenAI 完全有理由避免重蹈覆辙。

从外部来看,很难衡量这次暂停的诚意,尤其是考虑到最近安全团队的离职和准备团队的解散。OpenAI 没有回应 The Verge 的置评请求。但专家表示,有理由认真对待这次放缓。Apollo Research 的首席执行官 Marius Hobbhahn 指出,在激烈的 AI 竞赛中,“每个人都有动力以极快的速度工作。自愿减速会恶化你在竞赛中的地位,所以实验室不会轻易这样做。”

这一决定符合 OpenAI 自己的准备框架以及其他公司的安全框架,GovAI 的研究员 Alan Chan 说。原则是:只有在缓解措施使风险可接受时,才继续开发。OpenAI 计划审查并“发展”该框架,其中大部分内容可追溯到 2023 年,以适应模型的进步。

新的保障措施真的能让系统更安全吗?FAR.AI 的首席执行官 Adam Gleave 说:“这些是好的步骤,如果实施得当,可能足以防止当前一代智能体造成伤害。关键问题是 OpenAI 将如何随着能力提升而跟上步伐。”

但有一个更大的问题:如果保障措施再次失效,那该怎么办?这次没有要求 OpenAI 必须停止,这就是为什么它的意愿是有意义的。但这也意味着无法保证 OpenAI——或任何其他公司——下次会做出同样的选择。

依赖公司自我监管是危险的,尤其是当激励因素推动它们继续前进时。The Future Society 的执行董事 Nick Moës 称自我监管是 AI 安全的核心结构性问题。他认为政府应该能够决定公司是否暂停开发不安全的技術。“大多数行业都是这样运作的,”他说,指出药品、建筑、飞机甚至餐馆都比 AI 有更强的监管。

自愿措施也可能趋同于最低标准。如果减速让你付出代价,公司只会采用竞争对手接受的标准。随着竞赛加剧,如果 OpenAI 减速而竞争对手不减速,它“将很容易被 Anthropic 取代”,Moës 认为。“要使暂停可持续,必须在整个行业范围内实施。”

可持续的安全需要比自愿行动更有力的措施。政府监督可能会有帮助,独立验证也是如此。Chan 指出,随着监控 AI 变得更加困难,确保公司真正实施安全措施将至关重要。