AI 见闻
精选· 重要性 4/5

开放权重AI模型逼近前沿,安全差距依然存在

TechCrunch — AI··Rebecca Bellan·约 8 分钟阅读
中文导读

一份新报告显示,中国开放权重模型GLM-5.2在能力上已接近前沿模型,但安全防护远落后,引发对开源AI风险的担忧。

政策制定者正在讨论如何管理OpenAI的GPT-5等日益强大的人工智能系统。6 Sol和Anthropic的Mythos是一款中国开量级模型,缩小了与行业领导者的差距。GLM-5。2、来自中国Z.的开重AI模型。

ai,仅落后OpenAI的GPT-5几个月。5和Anthropic的克劳德作品4。根据人工智能安全非营利组织SaferAI的一份新报告,网络和生物能力为7。但前沿能力和安全实践之间的差距正在扩大。

根据SaferAI的评估,该非营利组织通过Z进行了评估。ai的公共API,GLM-5。2没有拒绝它被赋予的任何攻击性网络或两用生物学任务。相比之下,克劳德作品4。7”拒绝得如此一致,以至于SaferAI根本无法在上面完成CyberGym。

“(CyberGym是评估网络安全能力的基准。OpenAI在上个月Hugging Face违规事件之前的评估中使用了它。

)这清楚地提醒人们一些批评者多年来一直警告的问题:开放重量人工智能模型可能会将高性能的人工智能交到潜在攻击者手中,而一旦他们下载了重量,就无法监管他们如何使用该技术。随着开重模型迅速接近世界领先人工智能系统的能力,争论正在从它们是否能够竞争转向它们发布后社会如何管理风险。

SaferAI执行董事亨利·帕帕达托斯(Henry Papadatos)告诉TechCrunch:“能力的前沿不是风险的前沿,因此我们确实必须考虑缓解措施的状态,以正确评估风险。

”而Z. ai可以对其托管的API应用安全措施,一旦有人在自己的硬件上运行权重,这些保护措施就无法执行,他们可以删除或修改任何保护措施、微调模型或更改系统提示。

OpenAI和Anthropic等前沿开发人员倾向于依赖分类器、拒绝培训和API级控制等保障措施来限制危险的网络和生物援助。这些措施远非万无一失:越狱通常会绕过对已部署型号的保护。

远了人工智能安全非营利组织ai在xAI的Grok 4等前沿模型中发现了数百种通用越狱--定义为在最有害的请求上成功的可重复使用的密钥。5和谷歌DeepMind的Gemini 3。1亲。

报告称,当攻击者结合多种操纵技术(包括角色扮演、权威模仿、虚假对话历史和后续提示)来放大模型防御的弱点时,越狱就会成功。但封闭模型的保护措施对开放重量模型根本不起作用,开放重量模型旨在在任何具有任何保护措施或缺乏保护措施的基础设施上运行。

帕帕达托斯说:“目标显然应该是,任何人都可以使用好的功能--安全的功能,然后我们尝试删除坏的功能,即使是以开源的方式。”帕帕达托斯指出,一种可能有所帮助的技术被称为“训练前数据过滤”,即人工智能公司从其训练数据中删除攻击性网络安全信息,然后在策划的数据集上训练模型。

一些研究表明,这可以减少危险的生物知识,而不会损害整体模型性能。然而,对于网络安全来说,数据过滤的实用性要低得多。很难训练一个擅长编码但不是一个好黑客的通用模型。由于编码已经成为人工智能最大的赚钱机器,开发人员面临着不断改进这些功能的压力,即使他们正在寻找限制滥用的方法。

正因为如此,前沿开发人员越来越依赖于其他缓解措施。一种方法是有选择地限制网络安全援助模式将提供的种类。例如,Anthropic的Opus 5可以根据模型的系统卡搜索未编译的源代码中的漏洞,但不能搜索已编译的软件中的漏洞。

原因是这使得将作品5用于攻击目的变得更加困难。其他措施包括严格的部署前安全评估、发布风险评估以及在系统被认为过于危险时扣留模型权重。在GLM-5中。2的情况下,SaferAI说Z.

人工智能没有发布该模型的安全框架、部署前测试承诺或风险评估。TechCrunch询问了Z。ai在发布前是否进行了内部或第三方边境安全评估,但没有收到回应。中国领导人越来越认识到先进人工智能的风险。

在上个月的世界人工智能大会上,中国国家主席习近平强调了开放重量模型的重要性,同时也强调了确保人工智能仍然是人类严格控制下的工具的必要性。

斯坦福大学网络政策中心研究中国人工智能政策的格雷厄姆·韦伯斯特(Graham Webster)告诉TechCrunch,中国对人工智能制定了严格的监管法规,但这些规则历来关注政治敏感内容、错误信息和社会稳定,而不是攻击性网络能力和生物滥用等灾难性人工智能风险。

“美国。S.总的来说,人工智能思想家比中国社区更关心这种生存灾难性的[想法],”韦伯斯特说,并补充说,许多中国政策研究人员认为,如果真的会出现新型前沿风险,美国公司可能会首先遇到它。韦伯斯特继续说道:“中国系统有信心控制这些技术在中国境内的使用。

”“在中国上网是你的真实姓名所做的事情,公司可以被追究责任,用户可以被追究责任。

”韦伯斯特沉思道,模型提供商拒绝参与某些政治话题所使用的相同机制可能会进行调整,以确保模型拒绝完成攻击性网络攻击或不会带来不利的生物工程结果。他补充说,由于中国公司倾向于在幕后与监管机构协调,因此在发布之前很难知道他们正在进行哪些内部测试。

开放权重人工智能的支持者认为,释放权重对网络安全很重要,因为它可以让公司抵御攻击-拥抱脸依赖于GLM-5。2.保护自己免受OpenAI的入侵--因为如果他们知道即将发生什么,这可以让他们更好地为未来的威胁做好准备。

Hugging Face首席执行官克莱姆·德朗格(Clem Delangue)表示:“帮助阻止人工智能网络攻击的系统现在每天可以帮助防御数百万次网络攻击,同时帮助我们在攻击者利用漏洞之前识别和修复漏洞。

”本周在社交媒体帖子中。帕帕达托斯表示,这种好处经常被夸大,并不意味着“我们应该开源危险的能力。”他说:“我认为的要点是,我们不应该仅仅接受危险能力可以被任何地方的任何人轻松获得。”他强调,他认为该行业应该努力只让“良好的能力”轻松获得。

默认情况下,攻击者采用新工具的速度比防御者更快。

例如,勒索软件组可以在一周内改变其方法。医院不能。”

原文出处
Open-weight AI models are catching up to the frontier. The safety gap remains.

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读