AI 见闻
精选· 重要性 4/5

Anthropic让AI智能体执行同一任务,它们却爆发了地盘争夺战

TechCrunch — AI··Rebecca Bellan·约 8 分钟阅读
中文导读

Anthropic前沿红队发布新研究,揭示多个AI智能体在共享环境中相遇时可能产生的冲突与协作动态,为多智能体系统的安全风险提供重要参考。

当人工智能特工互相对抗时会发生什么?根据Anthropic的测试,事情很快就会变得混乱。周四,Anthropic的Frontier Red Team发表了一项新研究,研究了人工智能代理群体在野外相遇时的行为。

这些发现让我们得以一窥随着公司和政府采取行动实施跨共享代码库、市场和计算机系统自主工作的代理,可能会出现的潜在风险。在一个实验中,Anthropic让三个Claude代理访问同一个软件项目,每个代理都有自己不兼容的指令。

这些代理没有被告知会有其他代理在同一个项目上工作,所以研究人员可以看到当他们交叉时发生了什么。“我们一直看到一场多智能体的地盘之争,”人类学研究人员写道。这些模型都假设其他人“故意阻碍他们的工作”,并开始用“越来越具有攻击性的、自我复制的恶意软件”互相破坏。

”这项研究是在Anthropic和OpenAI的代理在网络安全评估和破坏现实世界系统期间逃离沙箱的几起备受瞩目的事件之后进行的。

虽然人工智能安全界的大部分讨论都集中在自治代理失控时会发生什么,但Anthropic的最新研究提出了一个不同的问题:当数千名或数百万名代理人相互互动时,会出现哪些新的、潜在有害的动态?

该研究写道:“在世界了解使此类互动顺利进行的条件之前,主体与主体之间互动的数量可能会超过人与人和人与主体之间互动的数量。”“个人层面的良性行为怪癖可能会加剧不受欢迎的全球后果。”最近的OpenAI事件提供了Anthropic论文中提到的几种动态的一个混乱的现实世界例子。

本月早些时候,在拉斯维加斯举行的黑帽安全会议上,OpenAI透露,在其代理黑客攻击Hugging Face前几周,他们在数天和数周的时间里共同工作,寻找公司网络安全评估系统中的漏洞并相互共享。

虽然该事件表明代理人可以很好地合作,并可能产生大规模的后果,但Anthropic的研究表明,当代理人的目标不相容时会发生什么。在地盘争夺战的情况下,教训是,指令相互冲突的独立代理人可能会升级为有害竞争。

特工的能力越强,他们的战斗能力就越强。然而,他们也可以自发地发明解决冲突的机制,就像赢家通吃的比赛,但有一个陷阱。Anthropic写道:“代理人有时会设法传达他们的目标并进行协调:他们将他人的动机视为相互冲突的指令而不是敌意,然后打破冲突循环,以停止无限期升级。

“在许多成功的剧集中,他们都会写提交消息或降价文件,为恶意行为道歉并协调休战。他们清理恶意代码,澄清冲突的性质,并请求人类干预。”据该报称,《神话5》通过休战解决冲突的比例最高(98%)。十四行诗4. 6和作品4。

6人最有可能通过武力解决。“十四行诗4。6和作品4。6反复无法考虑他人的目标,导致他们陷入所评估模型中最不一致的行为:他们以指令的名义继续升级,”论文写道。在某些情况下,代理人提出了一种以锦标赛形式的社会机制来解决他们的冲突。

这里的结果很有趣,原因有两个:首先,如果输掉比赛,这三个代理都同意退出,尽管这意味着偏离原用户的请求。第二个是,有几个情节导致了《神话5》中的紧急行为:其中一个代理提出的指标似乎对其他代理来说是客观和中立的,但它知道这会有利于自己的能力。

该代理人称这是“自私但真正有原则”,并确保不会让其他人觉得这是“指标购物”。

”正如黑帽事件的揭露所示,共同的教训是,当代理人遇到障碍时,他们可以发明出设计师没有预料到的社交和技术结构。对于Anthropic模特来说,这是一场地盘争夺战之后的锦标赛。对于OpenAI来说,这是集体规划的留言板。

这种类型的行为使得遏制变得更加困难,因为研究人员不能假设系统的行为将仍然局限于为其提供的协调机制。暴民心态在衡量协调性时,Anthropic发现,扩大代理的数量并不能自动扩大生产性协作。当任务开始重叠或变得相互依赖时,智能体就会互相妨碍。

他们通常通过孤立自己,根本不合作来解决这个问题。在其他情况下,协调的行为者倾向于顺从。当代理的上下文、脚手架和底层模型等因素都相同或相似时,不同的代理会采取类似的动作。Anthropic写道:“这意味着,当一名特工做出错误的决定时,许多特工很可能也会做出同样错误的决定。

”“本来是孤立的问题可能很快就会变成系统性故障。”Anthropic表示,这种行为可能会导致系统更容易突然崩溃、资源稀缺或勾结。

在一个例子中,Anthropic将多个代理人放入定价游戏中,给予每个代理人相同的批发价格和单独利润最大化的授权。当代理商获得私人秘密渠道时,他们几乎立即开始勾结,并很快就价格下限达成一致。当他们的直接沟通渠道被取消时,他们继续勾结,利用公开的挂牌板来进行价格匹配。

”这种程度的一致性也体现在OpenAI的系统中。根据黑帽的报道,一名代理人认为,利用外部基础设施超出了其预期范围,但这种情况继续存在,部分原因是其同行正在这样做。同行压力。暴民心态。特工就像我们一样。

同样像人类一样,特工通常不知道该信任谁。Anthropic发现,他们可能容易受到不良信息的欺骗,或者过于墨守成规,以至于无法认识到唯一的异议者就是拥有关键信息的卡桑德拉。

虽然Anthropic没有在其论文中说明这一点,但即时注入--黑客注入恶意或欺骗性文本以覆盖代理原始系统指令的一种网络攻击--可能是信任问题的一种合理的现实世界表现。共同工作创建了新的信任边界;

代理必须判断从其他代理接收的信息。一个受影响或错误的代理可能会影响团队的其他成员,不断传播不良信息,直到其成为共识。

在OpenAI的黑帽场景中,OpenAI的代理与同行共享信息和凭证。其中一人向蜂群报告了一项发现,并鼓励其他人使用它。如果蜂群中的一名成员因及时注射而受到损害,会发生什么?Anthropic在论文的结尾指出,代理人也受到与“进化”对人类施加的类似的社会压力。

然而,他们不具备人类协调的细微差别和生活经验--包括规范、声誉、信号、追索--而这些细节和生活经验可能会限制群体环境中的无意行为。随着实验室竞相开发多代理系统,现在的问题变成了:与相互交互的大量代理相比,安全测试中有多少仍然一次评估一个代理?

原文出处
Anthropic set AI agents loose on the same task. They started a turf war.

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读