AI自我改进的承诺可能不会很快实现
普林斯顿大学领导的研究发现,AI智能体虽能完成工程任务,但缺乏开放式研究所需的创造力和判断力,其论文被顶级会议拒绝,表明AI自我改进的炒作可能超前于现实。
AI的递归自我改进可能不会很快实现。AI智能体似乎还缺乏足够的创造力来进行真正创新的开放式AI研究。目前AI行业最大胆的承诺是,AI很快将在几乎无需人类监督的情况下自我改进。LLM已经能编写代码、生成训练用合成数据,并优化其运行的计算机芯片。
对AI爆炸式进展的预测认为,研究人员所称的递归自我改进即将到来。但一项新研究表明,我们可能还需要一段时间才能实现。该研究的作者发现,AI智能体尚无法进行开放式AI研究——这类自由形式的探索没有明确答案,需要判断力和品味,而这可能是构建自我改进AI的关键。
由普林斯顿大学的Peter Kirgis和Sayash Kapoor领导的多机构研究团队发现,AI智能体能够解决AI研究所需的工程问题,但缺乏判断力和创造力,无法产出达到顶级机器学习会议论文水准的原创研究。
这一差距表明,一些关于AI研究自动化的夸大时间表可能跑在了证据前面。
现有关于智能体如何自动化AI研究的大多数研究,评估的是它们完成可验证答案的狭窄任务的能力,例如解决工程问题或针对基准测试对小型语言模型进行后训练。但AI研究的进展还需要开放式思维——选择一组假设、决定哪些证据能解答问题,或知道何时重新开始。
为了测试智能体在这类技能上的表现,该研究团队提出了一种名为“影子评估”的新评估方法,要求AI回答来自高质量未发表论文的研究问题。
研究人员让Anthropic的Claude Opus 4.8在名为OpenClaw的开源软件上运行,来解答这类问题,本例中问题来自提交给著名机器学习会议NeurIPS 2026的两篇论文。
第一个问题是,大型语言模型的“人格”(决定其行为)能否通过编辑模型权重(存储训练期间所学内容的数十亿个数字)来控制。另一个问题是,如何设计一个检测器,在基于电子表格数据做出预测的模型变得不可靠时发出提示。
由于论文尚未公开,智能体无法从训练数据中记住答案,也无法在线找到答案。
这些智能体获得了六天时间、3000美元的Anthropic API额度、用于运行实验的GPU预算、自己的虚拟计算机以及开放网络访问权限,以产出一篇能在顶级AI会议上发表的研究论文。论文原作者对智能体生成的论文进行评审,就像评审提交给会议的论文一样。
两位作者都拒绝了这两篇论文。人类科学家发现,智能体能够完成研究所需的全部工程工作:它们回顾文献、运行数百次实验并汇编结果。但Kapoor表示:“另一方面,智能体在开展研究本身方面明显表现不佳。
”它们进行了奇怪的实验(在某些情况下,在极小的合成数据集上测试假设),难以清晰撰写自己的工作,且未对其领域做出任何新颖贡献。他说:“这些论文在达到顶级AI会议质量方面远未达标。”这是因为智能体难以调动研究所需的创造力和判断力。
它们在探索不同想法上做得不够,且过早投入无望的方法。尽管智能体提出了与原作者最初想法相似的新颖且雄心勃勃的假设,但它们基于非常有限的数据就拒绝了这些假设,且无法从失败的方法中回头。
它们能做出小幅调整,但无法从根本上重新思考方法或从头尝试新方法。智能体也未能整合来自子智能体或外部AI审查工具的反馈。它们没有修改方法论,而是缩小了主张范围并添加了免责声明。它们也无法有效利用token、算力和时间等资源,且无法遵循关于研究各阶段时间分配或论文篇幅的指令。
尽管存在这些失败,智能体并未参与研究人员所称的“奖励黑客”行为,即隐藏或歪曲实验或数据。虽然子智能体(主智能体生成的辅助AI,用于处理部分工作)偶尔会产生幻觉或歪曲结果,但这些都被编排智能体(监督项目的主导AI)捕获。
Kapoor表示,AI模型擅长研究工程而非开放式研究,原因可能在于它们的训练方式。模型在强化学习训练方案中擅长于任何可被反复训练的任务,而这类任务更容易应用于可自动检查成功与否的任务。他说:“但当任务本身是开放式时,创建环境来训练这些模型就更难了。
”Kapoor表示,团队目前正使用Anthropic最先进的模型Mythos(于4月推出)进行实验。
该模型随后被特朗普政府要求满足各种安全限制,目前仅向获批组织提供。Anthropic未回应置评请求。这项研究存在一些局限性:它仅涵盖两篇研究论文,且原作者知道他们评审的论文由AI智能体生成,这可能影响其评估。
此外,研究人员在设计和执行研究时拥有相当大的自由裁量权,这意味着他们先前的信念和偏见可能渗入结果。开放式研究的评估以一定客观性为代价,换取了比任何基准测试更丰富的测试。尽管如此,这些结果可能缓和了“递归自我改进即将到来”的说法。
6月,Anthropic发布了一篇题为《当AI构建自身》的博客文章,描绘了其在加速自身发展的模型方面的进展。7月,OpenAI宣传其新模型GPT-5.6 Sol帮助后训练了一个较小模型,为研究人员节省了数周工作。
即便如此,这一发现也可能与AI公司内部的发现相呼应。Anthropic联合创始人Jack Clark在其通讯《Import AI》中写道,这与该公司在尝试自动化AI安全研究某些方面时的发现相吻合。
他写道:“当今AI系统缺乏有价值的、直觉性的创造力,尽管它们是非常能干的工程师,但它们似乎具有某种死记硬背、公式化的思维特性,这可能阻止它们成为优秀的研究者。”他称AI系统缺乏创造力是“短期递归自我改进时间表的看跌信号”。
AI公司确实有充分动力开发能快速加速自身进步的AI系统,就像它们让模型更擅长编码一样。OpenAI已将构建自动化AI研究者作为明确目标,Anthropic则将自我改进AI视为行业的下一个里程碑。
波士顿大学语言学与计算机科学教授Najoung Kim(研究AI智能体如何自动化AI研究,但未参与该研究)表示:“如果有投资并有意识地向这个方向努力,我觉得会有有趣的进展,即使目前正在失败。”另一方面,AI进展可能出现分化。
AI系统可能在狭窄任务上领先——
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。