AI推理是否因错误原因而正确?
大型推理模型(LRM)在数学竞赛中夺金,但其思维链可能只是表面捷径,未必反映真实推理过程。本文探讨AI推理的有效性与解释性之间的张力。
人工智能的推理是否因错误的原因而正确?引言我直说了吧:AI的“推理”到底是怎么回事?抱歉用了引号。这种带引号的怀疑态度在2024年更为常见,当时那些经过专门训练的LLM表亲——现在被称为“大型推理模型”(LRM)——还是新鲜事物。
不过,鉴于OpenAI的“通用推理模型”在2026年5月一次性解决了一个著名的开放数学研究问题,如今再持这种态度似乎显得无礼。尽管如此,我仍不知该如何表达我对这些AI系统实际行为在科学解释上的困惑。
推理有多种技术定义形式,但基本过程很容易识别:通过将逻辑上相互衔接的中间步骤串联起来,得出合理的结论。我们用思维完成这一过程;LRM则使用所谓的思维链,这是一个术语,指模型在回答复杂查询前生成的合成文本流。
前一分钟,AI通过思维链推理的想法还被(苹果公司的一组研究人员)作为“思维幻觉”进行突出且可信的批评,称其在令人惊讶的简单条件下会“完全准确性崩溃”。
下一分钟,LRM就在国际数学奥林匹克竞赛中夺得金牌,这一壮举极具挑战性,以至于“即使是非常成功的数学家和科学家也可能终生将其列入简历”,正如科学家兼AI评论家加里·马库斯和欧内斯特·戴维斯在2025年所写。
如果这都不算“真正”推理的标志,那什么才算?但等等——不久之后,圣达菲研究所的更多研究表明,LRM甚至可以仅凭“表面捷径”就碾压精心设计的推理基准测试(例如一系列类比视觉谜题)。它们的行为看起来不像可泛化的推理,更像是在钻系统的空子。
然后,仿佛按下了“看我表演”的按钮:Google DeepMind和数学家陶哲轩(史上最伟大!)利用AI重新发现或改进了67个问题的解决方案,涵盖数学分析、组合学、几何和数论。黑子们,接受现实吧!
那LRM无法可靠推理的额外证据呢?即使它们拥有必要的算法和计算预算,却仍会遭遇一系列科学记录的失败状态,多到足以当滑梯玩。管他呢——我想这就是所谓的“锯齿状智能”吧(AI术语,意思是“能用就行”)。
从2025年底到2026年,情况就是这样。
我做了20年科学记者,其中一半时间报道AI,所以我知道不能指望快速发展的研究保持一致性。但即使对我而言,这种反复也有点过头了。借用阿尔·帕西诺在《局内人》中的台词:“我得到了两样东西:愤怒和好奇。
”我不认为这里有欺诈。我只想知道方向。AI推理能否既胡扯又不胡扯?如果是,这到底是怎么运作的?我知道该先问谁。梅兰妮·米切尔的AI生涯可追溯到1980年代,但近来她以直言不讳的AI真相讲述者著称,为《科学》杂志和她广受欢迎的通讯撰写清晰解释,并在圣达菲研究所从事研究。
(那项关于“表面捷径”的研究就是她的。)当我问她我们对AI推理究竟了解多少时,她的回答简短到能写在一张索引卡上。“第一:它有效。它改善了结果,”她说,指的是LRM在推理任务上比LLM更准确。
“第二:生成的实际文本”——即每个LRM为提升性能而被训练生成的思维链——“不一定忠实于[模型内部]发生的事情。第三:很多文本甚至没用。你其实可以把它去掉。”让我们来拆解第二点和第三点,因为“胡扯与不胡扯”的叠加态正是存在于这里。
思维链在2022年被半发现、半设计为LLM的提示技巧:给它们提供书面推理的例子(或者,著名的做法,直接要求它们“一步步思考”),它们就会对简单的逻辑和数学问题给出不那么愚蠢的答案。
从2024年OpenAI的o1模型开始,LRM通过生成此类提示(也称为推理痕迹或思考token)并将其反馈给自身,来训练自动化这一技巧。由于LRM本质上只是语言模型,这些额外的文本片段创造了一种看似令人信服的模型“思维过程”的纸面记录。
但事情没那么简单。越来越多的学术和行业研究对这些“中间token”是否忠实反映LRM内部运作提出质疑。
它们并非可审计的收据或准确的报告,而更像是亚利桑那州立大学研究员Subbarao Kambhampati所称的“喃喃自语”——是的,是语言片段,但其含义可能与任何可能发生的推理完全无关。
Kambhampati的实验室在2025年表明,用不正确或不相关的痕迹完全替换模型的正确“痕迹”,并不会降低其在形式推理任务上的表现。
与此同时,仅用正确的痕迹数据训练模型,仍会导致它偶尔生成无效的推理记录——即使它对原始问题给出了正确解答。纽约大学研究人员2024年的一篇论文表明,“无意义的填充token”——字面意义上的点串——可以有效地替代人类可读的“思维链”。
该论文作者之一、现任芝加哥丰田技术研究所教授的威廉·梅里尔直言:“无法保证思维链在任何意义上都必须有意义。
”纽约大学研究员帕维尔·伊兹梅洛夫也在Anthropic工作(并参与其最初的推理模型团队),他表示怀疑强化学习——LRM的典型训练方法——是否从一开始就激励模型产生忠实的思维链。“我的意思是,也许吧,”他告诉我,“但我觉得可能性不是很高。
”好吧,推理痕迹的语言内容可能存疑。但token本身肯定在模型输出中起作用吧?(想想弹球机:它靠硬币运行,而不是靠“我们信仰上帝”这几个字。)别急。
东北大学和加州大学伯克利分校2025年一篇关于前沿开源LRM的论文显示,它们30%至60%的“思考步骤”对模型回答基准数学问题“几乎没有因果影响”。砍掉其中一半,模型的表现几乎不受影响。
“我们在审查这些思维链提示时要小心,因为它们可能与最终输出无关,”该研究作者之一施伟彦说。因此,推理痕迹——这些本应区分LRM与单纯预测下一个词的LLM的东西——对模型的……推理来说,既不一定有意义,也不一定有因果关系?
我不是哲学家,但这似乎把“推理”的含义拉伸到了极限。Kambhampati的研究小组在其立场论文的标题中坦率地表达了厌倦(该论文在2026年国际机器学习会议上发表,这是该领域最负盛名的学术会议之一):“停止将中间token拟人化为推理/思维痕迹!
”需要明确的是,Kambhampati——人工智能促进协会前主席,具有AI规划算法背景——并不否认LRM能工作(当它们工作时)。“我们正处于奇妙的时代,”他告诉我,