AI 见闻
精选· 重要性 4/5

Lilian Weng 总结 35 篇论文:Harness 工程驱动递归自我改进

Latent Space (Swyx)··约 8 分钟阅读
中文导读

Lilian Weng 发布综述,强调 Harness 工程是递归自我改进的核心,而非直接修改权重;Anthropic、Google 等纷纷推出智能体产品,Meta 发布 Muse 图像/视频模型,Liquid AI 提出 Antidoom 方法减少推理循环失败。

[AINews] Lilian Weng 总结了 35 篇关于 Harness 工程用于 RSI 的论文平静的一天让我们得以阅读一些浓缩的见解恭喜 Meta Superintelligence 拥有全球排名前 2/3 的图像/视频模型!

这本来可能成为头条故事,但不幸的是,这几乎是我们关于 Muse Image/Video 的全部细节——没有论文,没有任何技术细节。尽管如此,这仍然击败了上个月的 Microsoft MAI 模型,这很不错。

我们是 Lilian Weng 的忠实粉丝,因此每当她发布研究总结时我们都会关注,尤其是现在她已成为 Thinky 的联合创始人,这样的总结更显珍贵。

今天,她正在思考 harness 与 RSI 的关系:尽管我们之前写过即使 Greg Brockman 现在也 quietly 支持智能体/harness 工程,

但像 Lilian 这样受人尊敬的思想家和 neolab 联合创始人也认同“即使许多 harness 改进最终被内化到核心模型中,指定目标和上下文的需求也不会消失”,这令人耳目一新。

她的文章梳理了每个人应该了解的主要经过验证的 harness 设计趋势,然后总结了 harness 优化文献,最著名的是 ACE 论文,以及更近期的趋势如 Meta-Harnesses,我们已在 AINews 上报道过。

这无疑也暗示了 Thinky 正在思考的内容,而不仅仅是交互模型。2026 年 7 月 6 日至 7 月 7 日的 AI 新闻。我们检查了 12 个子版块、544 个 Twitter 账号,没有进一步的 Discord。

AINews 网站允许你搜索所有过往期次。提醒一下,AINews 现在是 Latent Space 的一部分。你可以选择加入/退出邮件频率!

AI Twitter 回顾智能体产品、Harness 和长时间运行的工作流Anthropic 在 Claude 之上扩展了“后台智能体”用户体验:参与度最高的产品发布是 Claude Cowork 登陆移动端和网页端,将 Claude 定位为执行任务的后台队友,

而非前台聊天 UI。相关帖子展示了围绕共享主页标签和更紧密的 Chat/Cowork 集成的产品融合,来自 @mikeyk。

另外,Anthropic 在 @claudeai 的一则高互动公告中将付费计划对 Claude Fable 5 的访问延长至 7 月 12 日,尽管许多用户在 @kimmonismus 等人的反应中指出,相对于每周限制,这个时机有些尴尬。

Harness 工程日益成为智能体设计的核心:Lilian Weng 的新帖子被广泛引用,将递归自我改进重新定义为围绕 harness 而非直接权重自我修改;

Sakana 的总结将其与 The AI Scientist、ShinkaEvolve 和 Darwin Gödel Machine 联系起来。

LangChain 通过 @LangChain 和 @hwchase17 的帖子,以新的 Deep Agents 课程和开源 harness 项目呼应了同样的转变。

Google 也在将这一方向产品化:Gemini API Managed Agents 在 @_philschmid 和 @OfficialLoganK 的帖子中增加了后台执行、远程 MCP 服务器、自定义函数调用和凭据刷新。

实用的智能体基础设施越来越有主见:有几个值得注意的面向操作员的更新:Codex Mobile iOS 在 @Dimillian 和 @reach_vb 的帖子中增加了任务管理、过滤差异、SSH 密钥登录、分支比较和附件流程;

Hermes Agent 在 @Teknium 的帖子中增加了可插拔的秘密管理器以及原生 1Password 集成,并将会话/数据集导出为包括私有 Hugging Face 仓库在内的格式;

Weaviate 1.38 使其 MCP 服务器正式可用,并带有运行时门控写入权限,特别地,在 @victorialslocum 的帖子中,MCP_SERVER_WRITE_ACCESS_ENABLED 可以在不重启的情况下实时切换。

一个更具实验性的模式来自 @omarsar0,使用 Dial MCP 服务器,以便智能体可以通过电话/SMS/iMessage 升级决策,实现人在环控制。

模型和模态发布:音频、语音、机器人和媒体生成Meta 的 Muse Image/Muse Video 将智能体生成推向媒体:Meta Superintelligence Labs 在 @AIatMeta、

@alexandr_wang 和 @_tim_brooks 的公告中推出了 Muse Image 并预览了 Muse Video。值得注意的技术角度不仅是图像质量,而且是一个明确的智能体生成循环:规划、网络搜索、工具使用、代码执行和渲染前的自我完善。

Meta 还表示,性能随着扩展测试时计算而提升,并且自我完善行为是在强化学习期间涌现的,而非手工编写脚本,详见后续报道。

在公开评估中,Muse Image 在 Image Arena 排名中迅速升至第二位,仅次于 GPT Image 2,而 Muse Video 在 Video Arena 中首次亮相即排名第三,来自另一篇 Arena 帖子。

NVIDIA 和 Cohere 都发布了强大的音频产品:NVIDIA 发布了 Audex,一个 300 亿参数/30 亿活跃参数的 MoE 模型,具有 100 万上下文,用于统一的文本+音频工作,由 @HuggingPapers 总结,

@_weiping 提供了更详细的描述。该模型的核心主张是保留文本智能,同时通过单一的 MoE 主干增加广泛的音频生成和理解能力。

Cohere 推出了 Cohere Transcribe Arabic,被描述为 Apache 2.0 下最准确的开源阿拉伯语 ASR 模型,在 @cohere 和 @JayAlammar 的帖子中强调了方言、代码切换和带阿拉伯口音的英语。

开放机器人技术持续围绕 Hugging Face + NVIDIA 整合:NVIDIA 通过将 GR00T 1.7 和 Isaac Teleop 引入 LeRobot,将其机器人技术栈扩展到 HF 生态系统,旨在支持开放的人形机器人工作流程,

详见 @NVIDIARobotics 的公告和集成指南。

在具身智能方面,UMA 展示了强大的全栈机器人叙事:@RemiCadene 描述了一个小团队在 9 个月内构建的原型,而 Northstar 的揭晓和 @psermanet 的安全说明强调了垂直集成的硬件/软件以实现值得信赖的机器人。

训练、推理和训练后技术Liquid AI 的“Antidoom”直接针对推理循环失败模式:当天最清晰的技术发布之一是 Liquid AI 的 Antidoom,一种开源训练方法,用于减少小型推理模型重复 token 直至上下文耗尽的“末日循环”。

报告中的减少幅度显著:在贪婪采样下,LFM 2.5-2.6B 从 10.2% 降至 1.4%,Qwen 3.5-4B 从 22.9% 降至 1%,并带来了下游评估收益。

该方法名为 FTPO(最终 token 偏好优化),重新标记触发循环的 token 并将概率重新分配给替代方案,@helloiamleonie 和 @LiorOnAI 对此进行了很好的总结。这是该领域近期模式的一个好例子:消除特定失败模式,而不仅仅是扩展参数。

推理效率和压缩仍然是一个主要前沿:NVIDIA 的 Puzzle-75B-A9B 压缩工作通过 @omarsar0 受到强烈关注:压缩混合 MoE 父模型,同时保留推理、编码、长上下文和智能体质量,

在 H100 上实现约 2 倍服务器吞吐量和 100 万上下文并发从 1 个请求提升到 8 个。在工具方面,Nsight Python 1.0 在 @HagedornBastian 的帖子中发布,使 GPU 性能分析可通过 Python 脚本化。

Unsloth 还为 DeepSeek-V4-Flash 发布了 GGUFs,并支持导出到 NVFP4/FP8 以及加速 GRPO 和 MoE,详见 @danielhanchen 的更新。

智能体强化学习和验证正变得更加专业化:@cwolferesearch 强调了 GRPO 风格的归一化如何被调整用于任务或环境级别的智能体强化学习,以处理多轮环境中更高的奖励方差。

另外,@omarsar0 标记了斯坦福/NVIDIA/伯克利的一篇免训练验证器论文,该论文从评分 token 的 logits 中读取校准后的连续分数,在 Terminal-Bench V2、SWE-Bench Verified、

RoboRewardBench 和 MedAgentBench 上取得了强劲的结果,表明验证正在成为一个独立的缩放轴。

可解释性、模型内部和“J-Space”争论Anthropic 的 J-space 工作主导了可解释性讨论,但也引发了尖锐批评:社区在将其视为有用的机制分析和反对意识框架之间出现分歧。

来自 @danburonline、@paul_cal 和 @scaling 的强烈批评尤为突出。

原文出处
[AINews] Lilian Weng summarizes 35 papers on Harness Engineering for RSI

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读