AI 见闻
精选· 重要性 4/5

模拟正在接管AI:从奖励信号到物理世界的八阶段演进

Latent Space (Swyx)··约 8 分钟阅读
中文导读

本文梳理了自2022年以来,AI流水线中人类组件逐步被模型替代的八个阶段,从奖励信号、训练数据到教师、课程、研究者、环境乃至人类被试,最终指向物理世界。这一趋势意味着模拟正以更低成本、更快速度成为AI发展的核心驱动力。

按照AI标准,今天是个相当平静的周五,所以是时候退一步反思真正发生了什么。

如果你读过我们的2025年阅读清单,关注过我们对Z.ai GLM的报道,理解了Poolside的转型,一直跟进我们的AI for Science主题,并收听了今天的Simile播客,你不仅是Latent Space最忠实的读者之一,而且很可能也会得出这样的心智模型:

自2022年以来,每年生产机器智能的流水线中,都有一个组件从人工制造转向模型制造。这种转变不是渐进的,也不是均匀的——每次翻转都有一个“零号病人”,即一篇论文或一个产品,其中合成版本首次在前沿实验室成为关键支撑,从此未来已来,只是尚未普及。

如果你眯起眼睛看,我们过去所说的“合成数据”“合成评分标准”“AI研究员”和“端到端RL环境”,不过是越来越雄心勃勃的人类模拟——效果差10%,但便宜100倍,快10000倍。第一阶段:奖励信号(2022年)最先被合成化的,反直觉地,是评判者。

InstructGPT确立了如今经典的技巧:收集一次人类偏好,训练一个奖励模型,然后让策略针对模型而非人类进行优化。从策略的角度看,发放批准的东西已经是一个LLM。

Constitutional AI进一步推进,让AI根据一套原则自我批评(RLAIF),而Lee等人后来证明,AI反馈能以极低的成本匹配人类反馈。

当LLM-as-judge成为默认评估方法(MT-Bench、AlpacaEval)时,整个审批机制——奖励、批评、评估——都运行在模型评判模型之上。

第二阶段:训练数据(2023年)微软的Phi系列在标题中直接点明:Textbooks Are All You Need。一个在LLM合成的教科书质量数据上训练的小模型,其表现远超其参数规模,而phi-1.5证实了这不是偶然。

苹果的WRAP推广了这一做法:不只是生成数据,而是用LLM重写整个网络,预训练效率提升约3倍。

此后,流水线走向工业化——NVIDIA的Nemotron-4 340B将宽松许可的合成数据生成流水线作为主打特性发布,到2025年,推理轨迹语料库(由强推理模型生成的思维链)已成为预训练和中期训练的标准成分。

语料库,这个本应是最不可简化的人类输入,如今已大部分由模型编写。第三阶段:教师(2023年)ChatGPT API开放几周后,斯坦福的Alpaca证明,对GPT生成的指令进行600美元的微调,就能克隆前沿模型的大部分行为。

Vicuna用共享对话做到了这一点;Orca则用丰富的教师解释而非简单答案。

这项技术从模仿成熟为一种正规的训练纪律——on-policy广义知识蒸馏解决了训练/推理不匹配问题——并在DeepSeek-R1随旗舰模型发布一系列蒸馏模型时达到文化顶峰,使“教师是模型”成为此后每个小模型发布的默认假设。

第四阶段:课程(2024年)第1-3阶段使输入合成化;第4阶段是循环开始自我闭合的地方,因为模型开始决定接下来学什么。

这些组件早已存在——Self-Instruct(模型编写自己的指令集)和STaR(模型自举自己的推理轨迹)都是2022年的成果——但转折点出现在Meta的Self-Rewarding Language Models和SPIN表明模型可以生成自己的任务、评判自己的输出,

并超越其人类偏好数据的天花板。课程设计——历史上ML中最手工的部分,即凭品味决定下一步训练什么——变成了模型对自己做的事情。第五阶段:研究者(2026年)辅助时代(Copilot,然后是SWE智能体)让人类选择实验。

发现时代则不然。DeepMind的AlphaEvolve在2025年进化出了真正的新算法,而Sakana的AI Scientist(现已发表在Nature!)勾勒了完整的论文写作流水线。

最重要的时刻是Karpathy在2026年3月的自动研究:一个刻意最小化的棘轮循环,其中编码智能体修改真实的LLM训练设置,运行五分钟实验,仅在验证损失改善时保留更改,并通宵重复。

他自己的扩展运行将700个实验堆叠成20个保留的改进,将达到GPT-2的时间从2.02小时缩短到1.80小时——在他睡觉时发现了真实、可迁移的代码更改。

第六阶段:环境(2026年)RL的扩展瓶颈从模型转移到环境:你需要数千个可执行、可验证、专业现实的任务世界,而人类无法足够快地手工构建它们。

我们最近在z.ai/GLM-5.3一期中报道过:Z.ai构建了端到端合成环境的流水线——研究智能体挖掘真实工作模式并将其转换为具有隐藏状态的长视野环境,评判智能体尝试每个任务以确认其可解,验证器在未见参考解的情况下合成,然后用oracle、

no-op和未解状态检查进行压力测试,直到其二元奖励足够可靠,可直接用于训练。正如GLM-5.3发布所述,整个环境、评判和验证栈都是全合成的。同一周,Ornith-1.5发布,声称实现端到端自我改进——模型提出自己的任务并生成自己的RL展开。

健身房、裁判和记分牌现在都是模型。

第七阶段:人类被试(2025年)如果模型可以充当评判者、教师和环境,那么循环中剩下的人类角色就是被试——偏好、行为和需求的来源。这正是Simile正在取代的层。

这一谱系从Joon Sung Park的Generative Agents(Smallville,2023年)延伸到1,000人的生成式智能体模拟,其中基于两小时传记访谈构建的数字孪生,在复现其源人类的调查和行为反应方面,准确度达到85%,

而人类在两周后自我复现的准确度也差不多。

需要克服的主要障碍是:前沿模型被训练为智能体模型,这使它们难以模拟真实人类——因此Simile在访谈、交易数据和Open Science Framework注册的RCT上进行后训练,专门恢复人类的偏见、不一致性和因果纹理,并报告了模拟质量的早期Scaling Law。

随着Shopify的SimGym模拟购物者轨迹,以及腾讯的十亿人方法处于粗略的一端,焦点小组、用户研究和A/B测试小组正在变成推理工作负载。第八阶段:物理世界(2026年,进行中)网格的最后一行永远不会完全变红,而这正是重点。

Poolside的反向招聘信精确地划清了界限:世界上的问题分为受智力约束的问题(可通过扩展认知解决,很快会被开放权重商品化)和受实验约束的问题,后者“再多的智力也无法替代真实世界的实验反馈——10万个聪明头脑没有湿实验室也治不好癌症。

”他们的赌注是,AI的持久价值归属于拥有实验循环的人:AI作为“世界上最有价值的科学发现引擎”。生物方面正从另一个方向进行同样的游戏。

CZ Biohub正在将人类细胞图谱成像为虚拟细胞——因为in silico比in vivo便宜约1000倍且更快——并扩展到虚拟免疫系统,Chai、Xaira和Lila的数据中心形状实验室填补了AI for Science的栈。

物理世界是唯一无法完全合成的组件——只能逐细胞压缩成模型。指数从对角线开始再读一遍网格,第一个模式之下会出现第二个模式。

原文出处
[AINews] 10% worse, 100x cheaper, 10000x faster: Why Simulation is taking over

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读