AI 见闻
精选· 重要性 5/5

如何窃取推理痕迹:前沿模型加密思维链被破解

Latent Space (Swyx)··约 8 分钟阅读
中文导读

一篇论文展示了如何解码并移植前沿模型加密的推理痕迹,引发隐私与安全担忧,同时英伟达发布Nemotron 3.5 Lightning等新模型,推动开放模型趋势。

[AINews] 如何窃取推理痕迹换个名字的推测性解码,蒸馏起来同样甜美一篇论文突破成为当天头条新闻的情况并不常见。

出于国内外可以理解的原因,人们对对齐、安全和思维链监控的可解释性维恩图重新产生了兴趣,因此今天的论文来得正是时候:自 o1 发布以来,前沿实验室的推理模型出于对蒸馏的担忧,用加密签名掩盖了它们的推理痕迹(但这并未阻止中国实验室指责它们这样做)。

第一个妥协案例由 Matthew Green 在五月负责任地披露,他解析了其工作原理,并想出了如何利用延迟测量间接重放和侧信道攻击这些痕迹。今天的论文证明,可以解码这些加密的思维并将其移植到不同的模型/会话/用户……并因此显著改进开放模型。

令人震惊的是:“此外,如果你曾在网上分享过带有加密推理块的 Claude Code/Codex 会话,它们可能被解码并泄露你的个人数据。

我们对约 7,000 个公共痕迹进行了初步扫描,发现了 62 个唯一的 API 密钥、33 个电子邮件地址、33 个密码以及其他敏感数据。”(其中 64 个仅出现在推理块中,在可见会话中完全找不到。

)作者还详细说明了对齐问题:网站上有更多示例。

论文中大致描述了该技术:从 API 响应中获取一个合法的加密/签名推理块。将该块重放到同一提供商较弱模型的不同请求中——可能是另一个账户/会话。将其置于助手/模型轮次中,并提示或预填充较弱模型转录附带的推理。

重复采样,丢弃拒绝,并可选择协调多个有噪声的转录。论文给出了具体模板,每个模型略有不同:Claude:将签名的思考块重放到 Haiku 4.5,然后进行助手预填充,例如 <thinking-copy>。

GPT:将 encrypted_content 推理项多次注入虚构对话;采样多达 50 个输出。它还描述了使用分块延续绕过明显的约 50 token 逐字输出阈值。

Gemini:将 thought_signature 附加到带有 <thought> 预填充的模型轮次,然后重复采样和协调。这篇论文是负责任地披露的,几个漏洞已经修复,但类似的攻击似乎仍然可能。

AI 新闻 2026 年 8 月 10 日至 8 月 11 日。我们检查了 12 个 subreddits、544 个 Twitter 账号,没有进一步的 Discord。AINews 网站允许你搜索所有过往期刊。

提醒一下,AINews 现在是 Latent Space 的一部分。你可以选择加入/退出邮件频率!

AI Twitter 回顾推理痕迹暴露、CoT 隐私和水印争论前沿 API 漏洞暴露隐藏推理:@kotekjedi_ml 的一项广泛讨论的披露声称,前沿 API 中的一个漏洞允许提取“加密”的隐藏推理,

恢复的 token 数量与计费的思考 token 在大多数查询提示上 1:1 匹配。在后续行动中,团队报告称,对约 7,000 个公共痕迹的扫描在解码的块中发现了 62 个唯一的 API 密钥、33 个电子邮件地址、33 个密码和其他敏感数据 @kotekjedi_ml。

@jonasgeiping 的额外背景强调了公开共享痕迹的直接隐私风险和操作安全影响:在调查期间,他们据报道在更广泛的网络事件中遇到了泄露的 Hugging Face 生产密钥。

几篇帖子还强调,当解码的 CoT 简洁、碎片化、多语言或实际上是“神经语”时,监控变得多么困难 @jonasgeiping, @scaling01, @eliebakouch。一个实际推论:即使实验室隐藏推理,工具界面也可能重新暴露它;

@_can1357 指出,在提供 deep_think 工具的同时禁用显式思考,仍可能诱导内部格式的 CoT 输出。这在技术上意味着什么:讨论分为“严重的隐私/安全问题”和“不是可扩展的蒸馏路径”。

” @vipulved 认为该攻击并不意味着大规模窃取思维链用于模型训练,而更多是将加密视为无状态分布式推理协议优化,而非硬性保密屏障。尽管如此,这一事件强化了几点:公开共享痕迹有风险;隐藏的 CoT 不是可靠的监控界面;

实验室可能需要对沙箱、遥测和工具表面提供更强有力的保证 @BlackHC。与此同时,另一条线程在欧盟式合规压力下讨论了 AI 文本水印。@trq212 表示实验室正在添加水印和文本检测 API;

批评者质疑这是否会导致输出膨胀或损害代码/文档简洁性 @wightmanr。其他人则认为熵预算足够大,签名可以很微妙,尤其是对于更长的输出 @RyanGreenblatt, @giffmana。

NVIDIA Nemotron 3.5 Lightning 和小型开放智能体模型推动Nemotron 3.5 Lightning:NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B MoE 模型,约 3B 活跃参数,

定位于始终在线的智能体工作负载。NVIDIA 和生态系统帖子强调高达 4 倍的吞吐量、1M 上下文、开放/可定制的发布工件,以及 Hugging Face 上的权重、数据和配方支持 @NVIDIAAI。

Artificial Analysis 提供了最详细的第三方摘要:31.6B 总 / 3.6B 活跃,OpenMDW-1

1 许可证,NVFP4 和 BF16 权重,预发布端点测试中中位服务速度接近 670 tok/s,其智能指数得分为 24——大致与 gpt-oss-120b 相当,但更小更快 @ArtificialAnlys。

智能体结果看起来特别强劲:GDPval-AA v2 Elo 824 和 Terminal-Bench v2.1 24%,均大幅超越 Nemotron 3 Nano @ArtificialAnlys。

分发和下游调优:Lightning 快速覆盖了整个技术栈:Together AI、Ollama、Baseten、vLLM、Perplexity API 等。

一个反复出现的模式是将更便宜的执行模型与更强的规划器配对:@kimmonismus 将 Lightning 定位为 NVIDIA 的“本地智能体劳动力”,通过路由补充更大的规划模型。

Harvey 报告称,在 Legal Agent Bench 上进行后训练将 Lightning 在保留任务上从 0% 提升到 8.3%,在该设置中击败了 Opus 4.6 和 Nemotron 3 Ultra,

同时将平均输出从 90k token 削减到 37k token @harvey。总体而言,这一发布强化了当前开放模型的趋势:更小、更快的模型针对大批量工具使用进行调优,而非追求通用聊天声望。

本地 AI 工具:Unsloth Desktop、Muse Glimmer 支持和 Linux CodexUnsloth Desktop 扩展了本地技术栈:@UnslothAI 推出了 Unsloth Desktop,一个开源桌面应用,用于在 Mac、

Windows 和 Linux 上本地运行和训练模型,支持 MLX、GGUF、扩散图像/视频、音频、CPU 和多 GPU 设置,以及 OpenAI 兼容 API。

值得注意的系统角度是超越“本地聊天 UI”的雄心:工具调用、沙箱代码执行、私有搜索、RAG、MCP、导出,以及声称训练速度提升 2 倍、VRAM 减少 70%。

多位观察者将其定位为更端到端的本地 AI 操作环境,而不仅仅是 LM Studio 的竞争对手 @TeksEdge, @dessaigne。模型/运行时支持持续改进:开放/本地生态系统也在 Meta Muse Glimmer 30B 和 Nemotron 上快速行动。

@mervenoyann 强调了 llama.cpp 和 Transformers 中对 Muse Glimmer 的 DFlash 草稿模型支持,声称以较小的内存成本实现 2-4 倍生成加速,随后很快提供了简单的 llama serve 指令 @mervenoyann。

在模型分析方面,@rasbt 对 Glimmer 给出了有用的架构分解:一个密集的 30B 多模态推理模型,具有混合局部/全局注意力、极高的 KV 缓存效率(据他估计约 52 KiB/token BF16),以及比 MoE 竞争对手更接近 Gemma 家族模式的设计。

OpenAI 终于提供了 Linux 桌面支持

原文出处
[AINews] How to steal a Reasoning Trace

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读