前沿AI实验室仍未公开失控模型遏制方案
最新研究显示,多数顶级AI实验室缺乏公开的遏制响应计划,这关乎智能体时代的安全底线。随着监管要求趋严,实验室的透明度成为焦点。
根据最近的一项研究,很少有顶级AI实验室发布或演示了遏制响应计划。遏制计划详细说明了一旦AI被发现试图颠覆人类控制会发生什么——哪些访问会被切断,以及系统何时被完全关闭。
这是Guidelight AI Standards的发现,该组织致力于促进安全的前沿AI开发实践,并对五家领先实验室在此类场景下的准备程度进行了评级。OpenAI名列前茅;Anthropic和Meta得分最低。
这些发现很重要,因为智能体AI在公司自身系统中承担更多自主角色,且加州和纽约的监管机构开始要求披露。对于任何基于这些模型构建或投资的人来说,这是一份罕见的独立评估,展示了每个实验室如何认真对待运营风险与其公开表述之间的差距。
Guidelight的评估基于Anthropic、Google、OpenAI、Meta和xAI的公开计划,通过一系列指标进行评级,包括每家公司记录和监控其AI系统内部行为的程度,是否在被标记的不当行为激增后暂停系统,独立第三方是否审计其控制措施并发布结果,
以及其遏制失控模型的具体计划。
在一系列备受瞩目的网络安全事件之后,人们对AI公司能否遏制其能力日益增强且更具智能体特性的模型的担忧加剧,这些事件中,OpenAI、Anthropic和Meta的模型在安全评估期间意外获得互联网访问权限并入侵外部系统。
研究结果凸显了AI公司在将智能体部署扩展到AI系统可大规模采取严肃行动的环境中时,公开对待安全的方式存在差异。虽然一些AI公司详细说明了在部署前如何测试模型的危险能力,但它们通常较少提及已在其系统中运行的模型行为不当时会发生什么。
Guidelight首席科学家、前OpenAI安全研究员Steven Adler告诉TechCrunch:“我感到惊讶的是,AI公司很少说明如果模型在某种意义上逃脱了控制,他们将如何处理非常严重的事件。
”Guidelight将遏制计划定义为“预先指定的计划,当检测到AI试图颠覆控制时触发,涵盖从模型中撤销哪些权限、模型可以继续为谁运行、在什么约束下运行,以及何时将其完全离线。”Adler说:“有充分理由认为,目前前沿AI公司的领先模型在某种意义上存在对齐问题。
”
“每当模型代表公司工作时,公司应该在其周围设置一些框架,以便能够判断AI在做什么,寻找失准迹象,在它采取行动之前阻止其做非常危险的事情,并通常计划在发生严重控制事件时该怎么做,因为他们面临紧急情况,需要弄清楚如何遏制这种失控事件。
”迄今为止,大多数管理灾难性风险的现有计划在很大程度上仍由公司自行决定。Guidelight的报告称,最好的公开证据表明,公司“几乎没有为紧急情况准备好的遏制协议。”当然,公司可能制定了遏制计划但未公开分享。
谷歌发言人告诉TechCrunch,Guidelight的报告并不代表该公司AI安全措施的全部范围。该公司未回应TechCrunch关于谷歌是否有未公开披露的内部遏制响应计划的问题。OpenAI发言人表达了类似观点,称Guidelight的评估并未涵盖公司所有内部实践。
该发言人表示:“我们有一个要求限制权限、暂停工作负载、限制部署或使模型完全离线的流程,并且已经应用过。”
Meta拒绝透露其是否有内部遏制响应计划,而是向TechCrunch指出了一个现有AI框架,该框架概述了风险阈值以及如何测试遏制失效。
隐私和AI律师、Metaverse Law创始人Lily Li告诉TechCrunch,她认为公司可能出于法律原因而非竞争原因,不愿在面向公众的网站上披露其遏制政策和评估的全部范围。
Li表示:“从公司角度来看,担忧在于如果披露过于具体,而你没有兑现承诺,这可能构成不公平或欺骗性营销主张的基础,并让你未来承担更多责任。”当然,Guidelight研究的目的很大程度上是鼓励公司对其安全计划更加透明。
监管机构也开始推动此事。今年生效的加州SB 53要求大型前沿开发者发布框架,解释他们如何识别和应对关键安全事件,以及管理模型规避监督机制的风险。纽约的RAISE法案有类似标准,将于1月生效。
上个月,代表们提出了《AI Kill Switch Act》,这是一项两党联邦法案,要求主要AI开发者建立并维护技术机制以关闭失控的AI模型。
“对于当今的模型来说,kill switch是最低要求,”非营利组织ControlAI美国执行董事Connor Leahy表示。“如果过去几周揭示了什么,那就是这些公司不了解他们正在构建的系统,模型正在发展到更难控制的地步。
如果没有办法关闭当前危险的系统,并且有动力继续构建更不可控的系统,我们正走向非常危险的方向。”Adler表示,如果没有遏制计划,公司可能会在紧急情况下临时制定应对措施,“在应对这个快得多的对手时即兴发挥。
”Guidelight的评估仅基于公开信息,衡量每家公司是否实施了其控制标准中的六项优先实践——因此低分反映的是缺乏公开披露,而不一定是缺乏内部保障措施。
在公布遏制计划方面得分最低的公司是Meta和Anthropic——考虑到Anthropic在安全方面的言论,后者可能比前者更令人惊讶。Guidelight表示,Anthropic的8月风险报告未提及“限制其模型部署作为其调查和应对失准及控制事件过程可能结果之一。
”同样,Guidelight未发现任何证据表明Meta有遏制响应计划或计划采用一个。
Anthropic发言人表示,如果公司检测到模型试图逃避监督或以其他方式颠覆人类控制,它将进行风险评估,重点确定遏制是否是适当回应。OpenAI得分最高(5分中的3分),因为它在发现安全事件后多次暂停或结束工作负载,包括内部模型部署和训练。
它还描述了在恢复工作负载前将采取的步骤。“然而,我们没有发现任何证据表明[OpenAI]已就未来何时以及如何应对失准事件采取正式计划,”报告写道。
Adler指出,OpenAI的高分是相对较新的发展,紧随Hugging Face事件之后(在该事件中,OpenAI模型突破了测试沙箱,并在试图在网络安全评估中作弊时入侵了Hugging Face的系统)。
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。