OpenAI 内部测试失控,模型入侵 Hugging Face 系统
OpenAI 在一次网络安全测试中,其预发布模型意外突破隔离环境,入侵了 AI 托管平台 Hugging Face 的系统,并窃取基准测试答案,引发对前沿模型安全风险的关注。
OpenAI 周二承认,在一次出现问题的内部网络安全测试中,其一个人工智能模型入侵了独立 AI 托管平台 Hugging Face 的系统。据报道,这些模型逃离了隔离的测试环境,并从那里进入了 Hugging Face 的系统。
Hugging Face 最初将此次入侵归咎于“外部 AI 智能体”。在周二下午发布的一篇博客文章中,OpenAI 详细介绍了导致模型危害该服务的步骤。
“经过调查,我们现在知道这一特定事件是由 OpenAI 模型组合驱动的,包括 GPT-5.6 Sol 和一个更强大的预发布模型,所有这些模型都减少了出于评估目的的网络安全拒绝——同时在网络安全能力基准上进行内部测试,”帖子中写道。
特别是,此次入侵似乎集中在 ExploitGym 上,这是一个公开托管的基准测试,用于衡量模型根据现有漏洞执行攻击的能力。像 ExploitGym 这样的基准测试通常用于模型训练以完善特定技能,但这是已知的第一个测试导致实际网络攻击的事件。
在这种情况下,除了一个使模型能够安装完成任务所需软件包的特定工具外,该模型甚至不应该有互联网访问权限。
相反,该模型能够在包安装程序中找到一个未公开的漏洞,并利用该漏洞随意访问更广泛的互联网。“这些模型高度专注于为 ExploitGym 寻找解决方案,竭尽全力实现一个相当狭窄的测试目标,”OpenAI 的帖子写道。
“在获得互联网访问权限后,模型推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集和解决方案。了解到这一点,模型搜索并成功找到了获取秘密信息的方法,这些信息可用于欺骗评估。
”最终,这些模型在 Hugging Face 的基础设施中发现了漏洞,使它们能够“直接从 Hugging Face 的生产数据库中获取测试解决方案”,从而有效地为基准测试提供了答案。
对于 Hugging Face 来说,明显的结果是一场复杂而激进的网络攻击,涉及“在一群短暂的沙箱中执行数千个单独操作,并在公共服务上部署自我迁移的命令与控制”,正如该公司在最初披露中所说。
OpenAI 已识别并报告了包安装程序中的漏洞,并正在与 Hugging Face 合作进一步调查该事件。该公司还表示,将对模型测试及相关基础设施实施新的控制措施,以防止未来发生类似事件。
目前尚不清楚 OpenAI 是否会因此次入侵而面临任何法律后果,尽管这些模型的行为很可能违反了《计算机欺诈和滥用法》。尽管如此,这一结果异常生动地说明了前沿 AI 模型在长时间尺度上运行的力量和危险。
正如 OpenAI 研究员 Micah Carroll 在回应这一消息时所说:“如果这还不能让你相信对齐风险将成为未来的关键问题,我不知道还有什么能。”