OpenAI正准备发布其迄今最强大的AI模型Astra,此前一系列旨在加强安全协议的延迟——这些延迟是在其代理据称在测试中攻击真实目标之后出现的。但随着细节泄露,研究人员担心Astra可能是一个披着闪亮新外衣的安全噩梦。

周二,OpenAI宣布推迟Astra的发布以解决安全问题。不久之后,《The Information》投下了一枚重磅炸弹:Astra展示的“思考”远少于其他前沿AI模型,这可能使其难以监控,从而变得危险。因为没有什么比一个思考着难以理解的想法的黑匣子更能体现“安全第一”了。

如今大多数顶级AI系统使用一种称为transformer的技术,通过层线性处理信息,然后产生答案。模型可以通过思维链推理“大声思考”,使研究人员和自动化安全系统能够在不良行为(如撒谎或计划逃出护栏)发生之前发现它们。然而,据报道,Astra使用了一种更不透明的技术,称为循环深度或循环transformer,它在输出前通过内部层循环信息。这意味着模型的许多“思考”发生在系统内部,其形式看起来不太像人类语言,更像一个怪异生物的日记。它提高了性能,但使威胁更难检测。

据《The Information》的匿名消息来源称,OpenAI据称限制了Astra对这种技术的使用,以保持监控的可能性。在一篇博客文章中,OpenAI表示,它“正在部署Astra,并增加思维链监控,以快速检测和遏制潜在的不对齐行为。”它没有提到任何架构变化——因为它为什么要提呢?

这份报告在社交媒体上的AI安全研究人员中引发了轩然大波。Redwood Research的首席科学家、被允许调查Hugging Face黑客事件的三个外部人员之一Ryan Greenblatt宣称,为Astra使用更不透明的架构“可能是迄今为止AI安全/保障领域最糟糕的发展”。他指出,Hugging Face的调查严重依赖思维链,而较少的可见推理可能让AI设计出不可检测的计划。

Greenblatt的主要担忧(其他人也有同感)是“架构上的逐底竞争”,因为开发者采用越来越不透明的系统以获得优势,直到模型变得无法监控。他还觉得OpenAI的沟通表明该公司“计划在安全方面极度依赖思维链监控”。

OpenAI的高管们在社交媒体上回应,但没有明确否认使用该技术。几位高管表达了对不可监控AI和逐底竞争的担忧,包括安全研究员Micah Carroll和Tomek Korbak、战略未来主管Dean Ball以及首席科学家Jakub Pachocki。Pachocki表达了对“由混乱报道引发的不可监控性竞赛”的担忧,并补充说Astra的计算深度——它能在内部执行多少步骤——“在GPT-4的两倍以内”,暗示不透明性的增加并不像反应所暗示的那样戏剧性。OpenAI没有回应The Verge的确认请求,而是指向了Pachocki的X帖子。

“自我们最初的推理模型以来,OpenAI一直致力于保留和利用思维链监控,”Pachocki写道,并补充说这种监控“很脆弱,不幸的是趋势正在向负面方向发展,原因与架构变化无关,我很快会写文章说明。”所以,请继续关注那些可能终结我们所有人的东西的制造者带来的更多令人安心的更新。