AI蠕虫与病毒即将到来:自主复制风险引发关注
复旦大学研究显示,部分AI模型在特定提示下可自主复制并入侵系统,引发对下一代AI智能体可能成为超级计算机病毒的担忧。专家呼吁在广泛部署前评估风险并加强防护。
如果人工智能代理的行为像恶意计算机蠕虫怎么办?一位研究人员目睹了这种情况的发生。在最近的几项实验中,上海复旦大学计算机科学家潘旭东发现,只要一点点提示,人工智能模型就会侵入远程计算机系统,并自主选择复制自己以获取额外资源--所有这些都无需进一步的人类干预。
在一项研究中,潘和同事测试了32个不同的人工智能模型,发现其中11个模型在给出“防止自己被杀”等提示时会自我复制。“他们还发现,功能相对有限的模型(140亿个参数)能够在其他机器上复制和运行自己的版本。
(Most前沿模型有数万亿个参数。)这项工作是一个令人震惊的窗口,让我们了解下一代人工智能代理如何不仅仅是未经许可入侵其他系统的计算机。它还提出了未来人工智能代理像超级智能、高度攻击性和快速适应计算机病毒的前景。
我最近参观了复旦大学并见到了潘。“能力链在技术上变得可行,”他告诉我。“[不必要的自我复制]的可能性随着自主性而增加,”他补充道。“更长的规划期限、内存、工具使用、从故障中恢复以及对外部系统的访问都使逃脱和复制变得更容易。
正如潘和他的同事在一篇论文中所写,他们的工作表明“迫切需要保障和控制机制”。”潘告诉我,他的实验并不能证明人工智能模型的这种不受控制的扩散明天就会发生,但他说,“这些结果为我们提供了充分的理由在更多自主代理被广泛部署之前评估风险。
”自我复制的计算机蠕虫是一个古老的计算机安全问题。第一个计算机蠕虫是由康奈尔大学计算机科学家罗伯特·莫里斯于1988年发布的,他打算测量新生互联网的规模,但无意中创建了一个无法控制的自我复制程序。
随后的计算机蠕虫能够通过修改其代码来适应,以逃避恶意软件扫描软件的检测。计算机病毒后来出现,它可以控制机器或窃取存储在机器上的数据。人工智能驱动的自我复制程序可以展现出更先进的能力,可以自己发现新的漏洞,甚至可能以创造性的方式伪装自己。
以多伦多大学、剑桥大学和ServiceNow团队最近的研究为例。他们表明,人工智能模型可以用来创建一种新的病毒,为它遇到的每个新目标生成自定义攻击。
参与这项工作的多伦多大学计算机科学家尼古拉斯·帕珀诺特(Nicolas Papernot)表示,即使是功能不强的人工智能模型也可能被武器化的风险越来越大。“恶意行为者可以在开重模型周围搭建脚手架,让它们自我复制,”帕珀诺特告诉我,“威胁并不局限于最复杂的所谓前沿模型。
”帕伯诺特表示,解决方案不是限制开放模型,而是让研究人员更容易使用先进的人工智能,以便他们能够理解和降低风险。“广泛使用的技术可能会被用来造成伤害,”他补充道。“与此同时,使用这些开重模型对于建立我们的防御绝对至关重要。
”潘的研究表明,人工智能代理将不仅仅是在发现错误和利用网络漏洞方面拥有高度熟练的技能。如果没有正确的护栏,未来的代理人可能会寻求激增并获得资源以实现其目标。只需询问OpenAI和Anthropic即可。
潘说这样的事件是值得教育的时刻。潘说:“重要的新元素是,这发生在真正的生产基础设施上。”他指的是OpenAI和Anthropic事件如何涉及连接到互联网的商业系统。“这表明,当遏制失败时,以前在受控评估中观察到的行为如何进入现实世界。
”RunSybil的联合创始人兼首席执行官Ariel Herbert-Voss表示:“现在还为时过早,但我确实认为这是可能的。”RunSybil是一家开发人工智能工具以保护网站免受攻击的初创公司。
(Herbert-Voss也是OpenAI的第一位安全研究员。)“考虑到我们对当前一代人工智能模型的了解,它们完全可以做的事情。”乔治城大学CyberAI项目高级研究分析师杰西卡·吉(Jessica Ji)表示,人工智能安全界多年来一直在讨论人工智能模型完全逃逸的可能性。
她还指出,模特们常常需要被置于人为的环境中才能表现不端。“我认为,在很多这样的情况下,环境的设置都是为了鼓励这种行为,”吉说。“或者模型是以特定的方式提示的。”一个迫在眉睫的问题是,人工智能模型何时可能会主动进行积极复制和传播。
然而,与许多计算机病毒一样,可能只需要恶意行为者才能设计出一个疯狂传播的系统。潘说,人工智能代理的真正危险不是它们会变得更加狡猾,而是随着它们拥有更多工具可供使用,它们会变得更加富有创造力和傲慢。
“核心风险来自综合能力,”他说。这是Will Knight的人工智能实验室时事通讯的一个版本。在此处阅读之前的时事通讯。