智能体工具链的演进:从提示工程到模型内化
本文探讨AI智能体在2025年底突然变得可用的原因,提出模型能力与外部工具链(harness)两条曲线的交汇是关键,并预测未来工具链将转向服务人类注意力。
大约在2025年圣诞节前后,AI工程师注意到智能体发生了变化——它们开始真正工作了!很难确切指出原因。也许是我们终于有了假期时间来尝试最新模型上的最新智能体;也许是模型跨越了某个能力门槛;也许是模型周围的封装(wrapper)已经成熟。
我在这篇文章中要论证的是,后两者的融合所致:模型和工具链(harness)共同改进,它们的改进曲线在正确的时刻相交。这种动态有助于解释接下来会发生什么:模型不断将工具链吸收进其权重中,工程师不断删除被吸收的部分,而剩下的工具链将服务于人类的注意力而非模型。
Transformer的发明者之一Lukasz Kaiser在6月的“无监督学习”播客中说:“去年冬天、去年圣诞节的变化——有点难以确定。我的意思是,工具链变了,训练后也发生了一些变化,然后新的预训练模型出现了……但这感觉像是一个巨大的跳跃,很难确定是什么造成的。
”“发生了什么?”的答案不仅仅在于模型权重,还在于围绕权重成长起来的系统——答案就在智能体工具链中。回想2022年11月,当时ChatGPT是最先进的人工智能工具。
它唯一可用的能力是下一个token预测,以及一些来自人类反馈的强化学习(RLHF),这使它能够表现得像一个有用的助手。
没有工具,没有搜索,也没有推理。最初的ChatGPT仅限于其训练数据和您发送的提示词,不多不少。它就像缸中之脑。智能体工具链是LLM摆脱这种限制并与真实数字信息空间互动的方式。工具链到底是什么?
智能体工具链是除模型权重之外使智能体工作的一切:模型周围的环境、工具、上下文和护栏。没有工具链,模型就是缸中之脑。它可以采取认知行动,但需要工具链在真实的数字空间中执行该决策。工具链就像给模型的思想赋予了身体。
有了工具链,模型可以感知(上下文)、行动(工具)、持久化信息(记忆和压缩)并强制执行其边界(权限和护栏)。工具链1.0:过去,“螺栓固定时代”模型/工具链的进化路径上有两条曲线:工具链对模型的要求,以及模型在实践中能提供什么。
这两条曲线之间的差距等于智能体的有效性,而我认为这个差距的缩小导致了Lukasz Kaiser提到的智能体的切实改进。以下是差距如何分阶段缩小:ReAct,“纸上的工具链”(2022年10月):ReAct是一种提示技术,通过提示让模型推理。
它是纸上的智能体循环,位于模型权重之外。
它定义了“智能体循环”的概念:模型推理 -> 行动 -> 观察 -> 重复。同样,ReAct循环仅作为提示方法存在。提示是当时唯一存在的推理方法,没有人称之为“工具链”。
同年冬天,Toolformer(Meta,2023年2月)暗示工具使用可以被训练进模型,而不是通过提示。这有点像艾伦·图灵在计算机物理实现之前对计算机的想法——一个强大的想法,后来才被实现。(ReAct比ChatGPT早一个月——2022年10月对2022年11月)。
此时两条曲线都接近零,差距很小,因为我们才刚刚开始。AutoGPT/BabyAGI,“过早的自主”(2023年春季):使用AutoGPT/BabyAGI,工具链曲线领先于模型能力曲线。
两者都赋予模型完全自主权,要求模型充当“自主员工”,但此时的模型仍然不过是脆弱的下一个token预测器。循环不会给模型增加能力;循环放大模型已有的能力,而低于某个阈值时,循环放大的是错误而非可靠性。
考虑负复利:在20步任务中,每步95%的可靠性导致平均成功率约为36%。工具链交给模型一个它实际上没有机会完成的任务。这是差距最大的时候,接下来的18个月是对此的反应和缩小差距的尝试。
Cursor/Copilot,“退回到人在回路中”(2023-2024):第一批AI驱动的IDE认识到赋予模型过多自主权的失败模式。它们通过将工具链曲线拉低到模型曲线之下来缩小差距:不要直接给模型循环,而是给人循环,让人来编排循环,同时模型加速人的工作。
Devin的第一个版本试图将自主权交还给模型,但Answer.AI团队的一个测试显示这仍然为时过早,成功率约为15%。这证明IDE从完全自主撤退不是懦弱,而是正确的举动。然而,尽管主流策略是将工具链拉低到模型之下,模型仍在不断改进。
临近2024年底,随着第一个推理模型o1的推出,差距首次反转,我们开始看到模型能力过剩的第一个迹象。
Claude Code,“曲线相交”(2025年2月):2024年底的反转为某人创造了一个必须抓住的机会:如果模型现在领先于工具链,那么一个故意踩刹车的工具链就是在浪费能力。Claude Code是第一个为抓住这一机会而构建的编码智能体。
它放弃IDE转向终端,赋予模型bash和文件读写权限,并用权限规则取代了每次更改都需要人工批准。
模型再次被赋予循环,而这次它理解了任务。Boris Cherny和团队在构建Claude Code时考虑的是下一代模型的能力,而不是当前模型。它之所以大获成功,不是因为它第一个赋予模型自主权,而是因为它第一个在正确的时机这样做。
那个时机就是模型已经足够可靠、能够通过自主性取得成功的交叉点。Claude Code在六个月内增长到约10亿美元的ARR,这一切都是因为Anthropic抓住了曲线开始交汇时的机会。接下来发生的是,曲线不仅交汇,它们开始编织在一起。
工具链2.0:现在,“共同训练时代”今天,工具链很重要,而且是以我们可以衡量的方式。Harness-Bench在相同的106个任务上运行相同的模型,但使用不同的工具链,得分范围从52.4到76.2:模型零变化,差距达23.8个百分点。
智能体的一半是工具链。OpenAI在ARC-AGI-3上通过工具链变化也取得了类似结果。仅添加保留推理和压缩,GPT-5.6 Sol的ARC-AGI-3得分从13.3%增至38.3%,增加了两倍。
背后发生的事情是,强化学习(RL)已经进入了工具链。OpenAI在2025年5月的codex-1发布公告中说:“codex-1是在各种环境中针对现实世界编码任务使用强化学习进行训练的。”两条曲线结合并开始编织成一个统一的系统。
这是Toolformer梦想在现实中的体现。现在工具调用不是从外部提示,而是从模型的环境内部训练。然后,当模型在工具链环境中训练时,它们开始将工具链能力吸收进模型权重,例如学习如何利用自身上下文窗口的知识进行自动压缩。
GPT-5.1-Codex-Max发布时称:“第一个通过压缩原生训练以跨多个上下文窗口操作的模型。”一旦模型吸收了工具链能力,工具链就可以摆脱脚手架。这是通过减法来生产。来自Anthropic的Thariq Shihipar在……