新方法揭示AI模型隐藏推理,蒸馏争议再起
研究人员发现一种技术,可从前沿AI模型中提取隐藏的推理过程,并可能用于蒸馏攻击,引发关于模型安全与中美AI竞争的讨论。
计算机科学家最近发现了一种方法,可以提取前沿AI模型在处理复杂问题时进行的隐藏“思考”。这些发现提供了一些证据——尽管不是确凿的证据——表明某些中国模型可能是通过“蒸馏”美国模型的推理信息来训练的,因为它们的某些思维或推理模式似乎高度匹配。
研究人员还证明,该方法可用于从模型的内部推理中恢复个人信息,如密码和API密钥,尽管该漏洞已被修复。“我们测试的所有主要前沿模型提供商都存在这一漏洞,”德国图宾根大学的计算机科学家亚历山大·潘菲洛夫(Alexander Panfilov)说,他参与了这项工作。
“它可能导致个人信息泄露,并使得大规模推理蒸馏攻击成为可能。
”潘菲洛夫与来自图宾根大学、马克斯·普朗克研究所、AI安全研究所MATS Research以及安全公司Snyk的同事,在通过应用程序编程接口(API)访问的OpenAI、Anthropic和Google的前沿模型中发现了相同的问题。
在一篇阐述这项工作的论文中,研究人员表明,Moonshot AI的开放权重或可下载的中国模型Kimi K3,在特定提示词下,其输出与Claude Opus 4.8和GPT 5.6 Sol的隐藏推理痕迹(解决问题时涉及的书面推理步骤)惊人地相似。
尽管存在相似之处,但他们指出,这项工作“无法从因果上确证蒸馏”。他们发现另外两个开放权重模型——中国的DeepSeek和美国Thinking Machines公司的Inkling——并未表现出与Claude Opus的这种推理相似性。
Moonshot AI和Z.ai在发表时未回应置评请求。蒸馏是一种成熟且广泛使用的技术,用于高效地将现有模型的能力复制到新模型,尤其在开放权重或完全可下载模型的开发中常见。然而,最近蒸馏已成为一个有争议的话题,因为有人声称中国AI公司利用它来实质性地复制美国最优秀的模型。
今年2月,OpenAI告诉美国立法者,DeepSeek似乎复制了其一个模型来构建名为R1的推理模型。6月,Anthropic告诉立法者,阿里巴巴系统性地蒸馏了其模型以构建自己的Qwen模型。目前没有迹象表明中国AI公司使用了这种特定技术来蒸馏美国AI模型。
但潘菲洛夫及其合作者表示,使用他们的方法可以从封闭模型中蒸馏出比之前认为的更多的信息。迷你模型先进的AI模型通过将难题分解为组成部分,并以一种人工推理或“思维链”的方式依次分析来解决问题。公司倾向于对专有模型的推理保密,以防止他人利用它们训练新模型。
然而,它们通常也会以某种方式将加密的推理版本发送到用户的计算机,以卸载部分计算。研究人员的攻击依赖于大多数AI公司也提供不同规模的相关模型这一事实。较大的模型能力更强,但运行的计算成本更高,访问成本也更高。
用户可能会为某些任务选择更小、更弱的模型以降低成本。潘菲洛夫和他的同事发现,将加密的推理痕迹输入同一模型的较小版本,可以揭示其中隐藏的推理。较小的模型接受的对齐训练较少,这意味着与较大的模型不同,它们不太可能拒绝透露其内部想法。
“将消息替换为具有相同解密密钥但对齐较弱的较弱模型变体的想法非常巧妙,”瑞士苏黎世联邦理工学院专攻计算机安全的计算机科学家弗洛里安·特拉默(Florian Tramer)说。“这肯定正在成为一个问题。
”
同样的方法还揭示了秘密信息,包括从用户机器捕获的推理痕迹中嵌入的API密钥和密码。潘菲洛夫及其合著者上个月向OpenAI、Anthropic和Google通报了这一漏洞。每家公司都已调整其API以缓解该问题。
虽然不再可能通过这种方式提取私人信息,但潘菲洛夫表示,使用同样的方法仍可以发现一些推理痕迹。他说,完全修复蒸馏问题需要对这些公司的API工作方式进行根本性改革。
“我们重视对模型的独立研究,并已开始为报告中描述的重放行为制定短期缓解措施,”Anthropic发言人迈克尔·阿西曼(Michael Aciman)表示。他补充说,这项研究不涉及恢复加密密钥、访问Anthropic的基础设施或从其系统中恢复个人数据。
Google和OpenAI均拒绝置评。近几个月来,随着美国和中国公司以越来越强大的模型争夺AI霸权,蒸馏已成为一个具有地缘政治重要性的问题。对华鹰派声称,中国通过蒸馏美国技术来构建运行成本较低的开放权重模型,从而获得战略优势。
然而,其他人则认为,蒸馏是一种广泛使用的方法,有助于快速提升AI模型在某些领域的能力。
Meta首席执行官马克·扎克伯格(Mark Zuckerberg)本周在一篇博客文章中表示,蒸馏“是开源生态系统运作方式的一个重要原则”,并警告说,限制这种做法将使美国处于不利地位。
科技政策智库安全与新兴技术中心(CSET)的研究员凯尔·米勒(Kyle Miller)表示,目前尚不清楚蒸馏对中国有多大帮助。这是因为蒸馏只能在有限程度上增强现有模型的能力,而且中国公司似乎拥有在需要时完全从头构建尖端模型所需的专业知识。
“美国没有人知道蒸馏给中国实验室带来了多少好处,”米勒说。“如果取消中国实验室的蒸馏能力,我认为这不会极大地改变竞争格局。”为了测试开放权重模型是否可能从封闭模型中蒸馏而来,研究人员向每个模型提出了90个问题。
当他们向一些开放权重模型提供从专有模型捕获的推理痕迹的前几个词时,他们有时会看到这些开放模型生成非常相似的答案。研究人员表示,这一点在Kimi K3上尤其明显。此前,中国社交媒体上曾有人猜测,有可能发现并利用隐藏的推理痕迹进行蒸馏。
牛津大学计算机科学家亚林·加尔(Yarin Gal)表示,蒸馏不仅被广泛使用,还帮助AI更快地发展。“如果每个人都阻止其他人(进行蒸馏)成为常态,那么这也会对进展速度产生影响,”他说。
公司和政策制定者可能会推出旨在限制蒸馏的措施,但即便如此,AI模型仍可能以令人惊讶的方式继续揭示其内部思考。