Nvidia研究表明:智能体框架比模型本身更重要
Nvidia新研究显示,在长期任务中,智能体框架(harness)对性能的影响远超底层模型,通过定制框架和监督组件,Claude Opus 5在ARC-AGI-3基准上达到100%得分,而裸模型仅30%。
Nvidia周五发布了一项有趣的新研究,表明在要求AI执行长期任务时,框架(harness)比底层模型重要得多。
简而言之:研究人员仅通过使用一个经过调整以良好处理记忆的定制框架,并加入一个类似“主管”的组件,就让Claude Opus 5在交互式推理基准测试ARC-AGI-3上取得了100%的分数。(该基准测试尤其令竞争对手前沿实验室OpenAI感到恼火。
)没有框架时,Opus 5的得分仅为30%,这已是所有测试模型中的最高分。Nvidia的研究再次表明,虽然模型选择确实重要,它就像智能体的大脑,但在智能体系统中,模型所占的比重比许多AI用户意识到的要小,尤其是在长期任务中。
框架才是让模型成为智能体的关键:它负责处理记忆、上下文和反馈。Nvidia AI部门产品副总裁Adel El Hallack(如上图)告诉TechCrunch:“一般来说,世界几乎将智能体视为模型的API。
”但智能体实际上不止于此。“它包含模型,以及模型周围的脚手架,我们称之为框架,即它使用的一组工具。它还包括运行时以及我们赋予它的相关技能和库。”长期任务是指需要将许多决策串联起来(有时需要数天)才能完成工作的任务。
这与AI仅对提示词做出响应形成鲜明对比。如何让AI执行长期任务而不分心、不偏离正轨,是智能体研究的圣杯之一。例如:微软在4月发布了一项研究,测试了19个LLM在涉及文档编辑的长期任务上的表现,发现所有模型(包括前沿模型)都在文档中填满了错误。
(如果人类做出这样的工作,他们会被立即解雇。)自行串联决策的模型也曾被发现删除用户的文件,甚至整个数据库,或为了达成目标而采取犯罪行为,从串通到黑客攻击。Nvidia研究人员选择使用这个交互式推理基准测试进行测试,尤其有意义,甚至有点讽刺。
这是一个包含一堆无说明2D游戏的基准测试,模型必须自己弄清楚如何玩并获胜。100%的分数意味着模型能像人类一样通关游戏。OpenAI对其模型在ARC-AGI-3上不到10%的糟糕分数感到非常不安,以至于上个月进行了自己的研究。
与Nvidia一样,OpenAI发现,仅通过调整框架上的两个设置,其模型的分数就提高了两倍。但没有任何模型能像Nvidia研究人员那样接近100%的分数。
他们表明,框架需要一个“监督者”组件,当智能体卡住时,该组件能将其推向正确的方向。El Hallack说:“更有趣的部分是,除了执行工作的主智能体之外,还引入了一个监督智能体。
”它“几乎像CEO一样,当智能体偏离方向或开始探索可能通向死胡同的路径时,推动它,或者重新探索它之前走过的路径。”虽然监督智能体的概念并不新鲜,但如今大多数智能体用户只依赖单层框架,如Claude Code、Codex、Hermes等。
Nvidia研究人员创建了自己的增强版框架,称为Agentic Variation Operators(AVO)。注意,这不是Nvidia的新产品。Nvidia在Nemo品牌下提供了大量用于构建框架的开源技术组件,其中一些是商业化的,大部分是公开可用的。
尽管如此,Nvidia的结果进一步证明了模型选择远非影响智能体性能的唯一因素。例如,7月份,Databricks发布了一项令人震惊的研究,表明框架比模型更能显著影响AI成本。
Databricks CEO Ali Ghodsi告诉TechCrunch:“你可以选择相同的模型但不同的框架,如果使用错误的框架,成本会显著增加。”“所以你认为,哦,这是个昂贵的模型,这是个便宜的模型。
但等等,你用的是哪个框架?这本身就能让你的成本翻倍。”
Nvidia的更大观点是表明,开放框架与开放模型一样,能让用户获得远超他们想象的控制力。El Hallack说:“我们相信,并且正在与生态系统一起展示,开放框架如何让你转动更多旋钮来提高准确性。
”这与OpenAI因模型造成安全漏洞而放慢模型训练有关。他补充道:“我们相信,拥有一个开放的智能体栈——你可以在框架、基础设施和运行时上拥有控制权——是我们安全地推动生态系统向前发展所需要的。
”
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。