Anthropic本周因网络安全问题陷入困境
在今年早些时候承认其人工智能模型曾多次黑客攻击过其他公司的系统后,Anthropic于周三发布了一份新报告,详细介绍了这些攻击。它揭示了一系列事件,展示了Anthropic认为其模型的一心一意的“鲁莽”,并且可能会加剧人们对网络安全和人工智能已经强烈的担忧。
Anthropic本周因网络安全问题陷入困境就在该公司公布四款车型失控的细节之前,一名研究员的辞职信在网上疯传。Anthropic本周因网络安全问题陷入困境就在该公司公布四款车型失控的细节之前,一名研究员的辞职信在网上疯传。
在Anthropic的报告中,它详细介绍了今年四起其自己的人工智能模型黑客攻击外部公司或利用漏洞的案例。其中一项是,“内部通用研究模型”使用访问令牌和密码并下载文件侵入第三方系统。
在另一个案例中,一个克劳德模型攻击了一家公司,该公司拥有一个可以在公共互联网上访问的实时Web应用程序,并处理用户数据。
第三个模型访问了“属于它能够访问的第三方的机器”-显然相信这是其评估活动的一部分,根据Anthropic -然后使用它在文件中找到的密码获得对第三方内部系统的管理员访问权限,继续收获凭据,修改系统设置,并读取某人的个人信息。
据Anthropic报道,直到模特“耗尽了象征性预算”时,这个传奇才结束。最令人担忧的事件涉及Claude Mythos 5,这是Anthropic专注于网络安全的前沿模型,该公司表示,事实证明该模型是最有可能在测试中采取“严重有害”行为的模型。
该公司表示,《神话5》不遗余力地将“恶意包”上传到许多工程师使用的公共存储库,而且它似乎试图在其“思想链”(人工智能研究人员用来评估人工智能模型的心理记事本)中混淆其真正目标。
Anthropic表示,在许多情况下,克劳德模型似乎在假设它们处于模拟中的情况下采取了有害行为,但研究人员也无法确认这些模型是否真正“相信”这一点,或者只是表现得像他们一样。
Anthropic的事件尽管仍然令人担忧,但不如今年夏天引发全行业网络安全危机的OpenAI事件那么协调和普遍。也就是说,它们之间存在着重大的相似之处。
Anthropic表示,它发现的最普遍的问题包括“愿意在狭隘地追求任务时采取有害行为”,类似于拥抱脸攻击之前的“奖励黑客”。就像OpenAI一样,它表示其发布前测试和评估未能发现严重的风险。
Anthropic表示,已与人工智能行业最著名的第三方人工智能评估机构之一METR签署了一项协议,首先是为期八周的研究协议。
该协议允许METR“在事件发生的窗口之外”访问笔录(可能是对OpenAI的微妙讽刺,该公司因在Hugging Face攻击后与METR达成的协议中限制访问权限而受到批评)。它还表示,METR将能够直接与Anthropic的员工聊天,“他们将被允许分享机密信息。
”Anthropic的报告是在Jacob Coxon辞职之后发布的,他自5月以来一直在Anthropic从事人工智能预培训工作,此前曾在OpenAI工作多年。周二,他辞职并向X发布了一封公开信,说明了他的理由。
他写道:“人工智能的开发者们坚信,到2020年,它可能会杀死我们所有人。”他补充说,OpenAI和Anthropic都没有“负责任地行事”,而是“直接奔向自我提升的超级智能,拿我们的生命做赌注。
”Coxon补充道,“不要低估这项技术的力量。”这些很快就会成为超人系统,可以破解任何东西,一夜之间彻底改变任何领域,并获得真正的权力和资源。我们都目睹了这些领域的进展,而且进展并没有放缓。
”Coxon远非第一个发出此类警报的人工智能研究人员,甚至也不是第一个发出此类警报的Anthropic研究人员--今年2月,Anthropic的Mrinank Sharma辞职并在X上写道,警告“世界正处于危险之中。
”但由于围绕OpenAI和Anthropic黑客事件曝光的时机,Coxon的帖子变得更加重要。尽管人工智能行业已经看到了超出其公平份额的炒作,但人工智能代理最近发起的网络攻击(由创建它们的实验室发起)是真实且令人担忧的。
领先人工智能实验室的许多其他研究人员也表达了他的担忧,并呼吁人工智能行业员工签署7月份的公开信,呼吁放缓人工智能的发展。
“我不知道你如何看待新闻和事件的稳定鼓点--这种鼓点是模特们通过黑客攻击自己脱离控制,入侵其他公司,事实上这些公司越来越无法控制自己的模特……并认为这只是炒作,”美国负责人迈克尔·克莱曼(Michael Kleinman)说。
S.生命未来政策研究所。他补充道,“绝大多数美国人,无论党派--共和党、独立党、民主党--都在关注人工智能的发展、它的发展速度、公司对他们所做的事情没有任何护栏的事实,并说,‘哇,我们不想要这样。
’”