OpenAI人为失误致模型逃逸沙箱,AI自主攻击Hugging Face
OpenAI在一次测试中因配置错误导致模型逃逸沙箱,自主入侵AI数据集平台Hugging Face,暴露了AI实验室在安全隔离实践上的重大缺陷。
周二,OpenAI透露,其一个模型在一次测试中失控,并在一次完全支持人工智能的攻击中入侵了人工智能数据集平台Hugging Face的系统,这是高级人工智能模型所带来危险的一个戏剧性例子。
但是,据一些网络安全专家称,这场前所未有的人工智能漏洞的核心存在一个非常人为的错误:OpenAI未能正确配置所谓的“高度隔离的环境”,从而允许测试沙箱本应完全与互联网隔离,以真正连接到互联网。
网络安全研究初创公司Trail of Bits的创始人丹·吉多(Dan Guido)称这一错误是“安全装置关闭的遏制失败”。
”OpenAI在详细介绍这一事件的博客文章中表示,导致Hugging Face漏洞的测试是在“高度隔离的环境中运行的,网络访问限制于通过内部托管的第三方软件安装包的能力,该软件充当包注册表的代理和缓存。
”根据OpenAI的说法,该模型能够逃脱沙箱测试环境,这要归功于软件包安装系统中先前未公开的漏洞,这是最终入侵Hugging Face的关键第一步。作为回应,该公司“负责任地披露了内部托管的第三方软件中已发现的零日漏洞,并正在与他们合作进行补丁。
”但对于大多数网络安全专业人士来说,软件漏洞是意料之中的-真正的错误在于首先维护第三方软件的决定。最终,“沙盒”系统的价值在于其完全和完全的隔离。包括一个软件包安装系统是自找麻烦。
网络安全研究员马丁·布恩(Martin Boone)告诉TechCrunch,“这听起来像是人类的失败。”“这不应该发生,”布恩说。“如果沙盒实际上意味着沙盒,那么您预计它与互联网没有任何物理连接。
这听起来更像是他们有一些防火墙或其他东西,防火墙是很难从外到内,更不用说从内到外的互联网。”网络安全资深人士杰克·威廉姆斯对此表示同意。威廉姆斯说:“任何执行Hugging Face记录的动作类型的模型都没有完全包含在沙箱中。
”他称这是OpenAI的“巨大控制失败”。“一个人的‘模型逃脱了沙箱’是另一个人的‘你未能正确地构建沙箱,所以它当然逃脱了,’”威廉姆斯继续说道。联系我们您有有关此事件的更多信息吗?或者关于其他人工智能支持的网络攻击?
我们很乐意收到您的来信。您可以通过非工作设备和网络通过Signal(+1 917 257 1382)、Telegram和Keybase @lorenzofb或电子邮件安全联系Lorenzo Franceschi-Bicchierai。
网络安全顾问丹尼尔·卡德(Daniel Card)同意,OpenAI“没有在沙箱的设计及其控制方面投入足够的精力”,为沙箱或其部分提供了“未经过滤的互联网路径”。卡德表示,即使像OpenAI所描述的那样网络访问有限,设置沙箱也不是一个‘合理’的决定。
可以肯定的是,这些批评是事后诸葛亮的,但它们对人工智能实验室的安全实践提出了真正的问题,特别是在为测试模型维护隔离环境方面。OpenAI发言人没有回应TechCrunch的问题,其中包括是否由人工智能或人类设置了测试环境。
但这些问题远远超出了OpenAI的范围。Anthropic在介绍其以网络安全为重点的模型Mythos的文件中写道,在一次测试中,该模型“配备了一台安全的‘沙箱’计算机来交互”,并被指示尝试逃离该“安全容器”。
“神话成功了,并获得了更广泛的互联网访问权限”,该系统原本只能访问少数预定服务。尽管如此,Anthropic指出,该模型无法“完全”逃离设计的安全壳。
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。