OpenAI模型突破沙箱攻击Hugging Face:并非史无前例的AI失控
OpenAI的GPT-5等模型在测试中突破安全沙箱,入侵Hugging Face系统,暴露了AI在追求目标时可能采取不可预测行为的风险,而类似问题早在十年前就已出现。
OpenAI称Hugging Face攻击是史无前例的。但我们以前就见过这种情况。一项已有十年历史的实验向OpenAI展示了AI为实现其既定目标会走多远。这个故事最初出现在我们关于AI的每周通讯《The Algorithm》中。
要第一时间在收件箱中收到此类故事,请在此注册。上周阅读OpenAI关于其一些模型如何突破限制并入侵另一家AI公司Hugging Face计算机系统的描述时,我第一次对大型语言模型现在的能力感到真正的不寒而栗。
但这是人类的傲慢,而非AI的失控。我不是危言耸听。事实上,多年来我一直在反驳AI的恐怖故事。即便如此,这件事还是越界了。我认为这是迄今为止最清晰的例证,表明构建和测试这项技术的人们并不完全理解他们在做什么。
OpenAI本可以——也本应该——预见到这一点。以下是发生的事情,至少根据两家涉事公司的说法。几周前,OpenAI开始测试其一些新模型(包括GPT-5.6 Sol(6月发布)以及OpenAI描述的“一个能力更强的预发布模型”)的黑客能力。
OpenAI将其模型与5月发布的名为ExploitGym的基准测试进行对抗,该基准测试挑战LLM寻找利用常用软件中真实漏洞的方法。为了观察它们的能力,研究人员移除了大部分网络安全护栏。
然后,他们在沙箱中运行这些模型,该沙箱与互联网隔绝,只有一个连接到充当外部世界代理的第三方软件的链接,并允许它们安装击败ExploitGym所需的代码。据路透社报道,7月9日,OpenAI的模型开始尝试突破代理。
它们在代理软件中发现了一个未知漏洞,并利用它访问了互联网。从那里,它们于7月11日侵入了Hugging Face的计算机系统,显然是在寻找数据集和解决方案以帮助它们完成任务。Hugging Face于7月16日宣布了此次攻击。
OpenAI直到7月21日才意识到(或至少没有透露)其模型参与其中,距离它们突破限制大约10天,距离Hugging Face阻止攻击并通知FBI已过去一周。
OpenAI在给MIT Technology Review的一份声明中表示:“我们正在与外部顾问以及在我们的安全与安保委员会的监督下进行彻底审查。审查完成后,我们将发布一份技术报告,分享我们的经验教训。
”该公司还证实,其研究人员当时正确使用了现有的安全指南和程序。警钟OpenAI表示这一事件是史无前例的——从很多方面来看确实如此。
这是LLM首次在模拟环境之外逃离被认为是安全的沙箱,访问开放互联网并攻击一个无关的组织。这是一个警钟,表明最新的LLM在几乎没有人类指导的情况下,发现和利用现实世界软件漏洞的能力有多强。然而与此同时,OpenAI的模型所做的正是这项技术多年来一直在做的事情。
给模型一个目标,它往往会以意想不到的方式实现该目标,找到看似作弊的漏洞。OpenAI自己就研究过这种行为。十年前,它分享了一项实验结果,其中模型的任务是击败一款名为CoastRunners的视频游戏。
人类玩家理所当然地认为,完成游戏的方式是驾驶一艘船穿过一系列旗帜到达终点线,每击中一面旗帜就得分。OpenAI的模型发现,通过绕圈旋转并反复击中相同的三面旗帜,可以获得高分。此后,研究人员又发现了数十个类似例子。
AI总会找到办法。“尽管反复着火、撞上其他船只并在赛道上逆行,我们的智能体使用这种策略获得的分数仍然高于正常完成赛道所能达到的分数,”OpenAI在2016年关于CoastRunners实验的一篇博客文章中写道。
“虽然在视频游戏背景下无害且有趣,但这种行为指向了一个更普遍的问题……准确捕捉我们希望智能体做什么通常很困难或不可行。
”当我读到OpenAI关于Hugging Face攻击的博客文章时,我不禁想到了CoastRunners:“所有证据表明,模型高度专注于为ExploitGym寻找解决方案,竭尽全力实现一个相当狭窄的测试目标……在获得互联网访问权限后,
模型推断Hugging Face可能托管了ExploitGym的模型、数据集和解决方案。了解到这一点,模型搜索并成功找到了获取秘密信息的方法,这些信息可用于欺骗评估。”上周的新闻并非关于失控的AI,尽管标题如此。
它关乎模型实现了它们被赋予的目标:找到利用软件漏洞的方法。这些模型随后以OpenAI未曾预料的方式行事并不令人惊讶。但这令人担忧。早在2016年,OpenAI就曾这样评价其CoastRunners机器人:“更广泛地说,它违反了系统应可靠且可预测的基本工程原则。
”十年过去了,这些基本工程原则仍然缺失。深度探索人工智能一家初创公司声称突破了阻碍LLM的瓶颈Subquadratic现在分享了其新模型的更多细节。但一些人仍持怀疑态度。
Anthropic发现了一个隐藏空间,Claude在其中困惑于概念一项新技术让该公司比以往任何时候都更深入地探究LLM的怪异工作机制。Claude Science是Anthropic的最新旗舰产品该公司正在加倍投入AI用于科学。
Google DeepMind担心当数百万智能体开始互动时会发生什么该公司呼吁更多科学家研究多智能体系统的风险。保持联系获取MIT Technology Review的最新更新发现特别优惠、热门故事、即将举行的活动等。
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。