参数之死:Z.ai CEO唐杰谈GLM 5.3与新的后训练扩展定律
Z.ai CEO唐杰指出,模型能力不再由参数数量决定,而是由数据、算力分配和运行环境共同决定。GLM 5.3通过长时程强化学习实现性能飞跃,标志着后训练扩展的新范式。
我们之前曾非常兴奋地报道过GLM 5.2,唐杰教授相信年底前会出现一个开放权重的Fable级模型(快速检查——还剩134天,现在有两个2-3T参数的模型(Qwen 3.8 Max和Kimi K3),估计Fable有3-7T参数,在AA指数上仅高出2个百分点)。
唐杰教授回到X平台告诉我们,我们对模型规模的简写已不再足够:“参数数量只有在与其他三个因素一起考虑时才有意义——你拥有多少数据、你打算在哪里使用算力、谁将在什么条件下运行模型。
”我们过去几年在Latent Space中已经讨论过Chinchilla(以及后Chinchilla)扩展定律,因此我们跳过历史课,但有必要明确为什么Chinchilla的假设在推理拐点世界中是错误的(没有固定数字,在200-900 token/参数之间,
引用Roberts等人关于任务依赖性的观点)。简而言之:记忆更偏好更多参数,推理更偏好更多的后训练数据和有效深度。GLM-5.3的巨大飞跃完全来自长时程环境上的强化学习:这些环境现在涵盖了更广泛的生产工作流程,任务设计围绕工程和研究工作在实际中的执行方式展开。
有些任务相当于经验丰富的工程师数天的工作量。
例如,在ML基础设施任务中,模型可能获得与工程师相同的工作环境,可以访问计算集群、存储系统、内部文档、代码库和实验结果。它必须诊断整个训练栈中的瓶颈,实施优化,运行实验,并在保持正确性的同时提供可衡量的端到端加速。
在这一级别的环境上训练,推动模型端到端地承担实质性工作,而不是依赖用户分解问题并监督每一步。对于那些关注递归自我改进故事的人来说,他们的整个环境以及评判和验证过程都是完全合成的:随着智能体能力的提高,扩展后训练的难度从模型转移到环境。
一个有用的任务环境必须是可执行的、可验证的,并且接近真实专业工作——我们需要很多这样的环境,而不是少数手工构建的。为了扩展这一过程,我们构建了端到端合成环境的流水线,对于部分任务,还合成了RL奖励信号。
研究智能体从真实工作中收集任务模式,并将其转化为具有多步依赖和隐藏状态的可运行的长期环境;然后,评判智能体尝试每个任务,以验证它是否确实可解决。
验证器在无法访问参考解决方案的情况下合成,而求解器轨迹用于发现和关闭奖励捷径。一个通过oracle、no-op和未解决状态检查的验证器,会产生足够可靠的二元奖励,可直接用于训练。
为了终结对参数数量的痴迷,唐杰教授确定了5个扩展旋钮,包括使用新的XA-YB符号的MoE稀疏性。他指出,高级技能(例如,发现软件漏洞)不是检索/记忆问题。它们需要携带长因果链(20+推理步骤)而不丢失线索。
一旦达到一定的知识持有阈值,这种能力就不再存在于总参数数量中。而且看起来还有更多工作要做。AI新闻,2026年8月18日至8月19日。我们检查了12个subreddits、544个Twitter账号,没有进一步的Discord。
AINews网站允许你搜索所有过往期刊。提醒一下,AINews现在是Latent Space的一部分。你可以选择加入/退出邮件频率!AI Twitter回顾:开放权重模型、压缩和基准测试动态。
Ornith-1.5作为一个严肃的新开放模型系列亮相:@ornith_ 发布了Ornith-1.5,提供9B密集、35B MoE和397B MoE变体,采用MIT许可,量化格式包括FP8、GGUF、MLX和NVFP4。
其核心主张是端到端自我改进:模型提出任务、生成脚手架,并产生RL rollout以创造新的训练体验。
报告的评估结果在智能体/编码工作负载上表现强劲,包括Terminal-Bench 2.1:86.1,SWE-Bench Verified:86,DeepSWE:56,HLE:44.6,以及Tool Decathlon:71.2。
该版本很快被vLLM和Ollama集成到服务栈中。
压缩继续变得更加激进,而不会完全丧失实用性:@UnslothAI和@danielhanchen发布了使用Dynamic V3的新Qwen3.8-27B GGUF,声称在相同大小下准确率提高约10%,并发布了1-bit量化版本,
在8GB RAM上运行时仍保留约77%的BF16准确率。他们的新Divergence-300指标使用来自Terminal Bench、DeepSWE和相关任务的未见示例,在更长生成中扩展了top-1%贪婪准确率。
智能体和法律评估榜单继续洗牌:@arena 发布了Agent Arena的帕累托视图,其中Claude Opus 5 (High)在质量上领先,但Kimi K3、GLM 5.2、Grok 4.5和GPT-5.6 Luna等低成本模型定义了许多价值前沿。
另外,@ValsAI报告Grok 4.6在Legal Research Bench上排名第3/49,得分48.1%,支持500k上下文、工具/图像/文件,且定价相对较低。
对于开放模型,@ValsAI还强调GLM 5.3在开放权重模型中,于Terminal Bench排名第2,Legal Bench排名第3,Skills Bench排名第6。
智能体框架成为新的竞争层。DeepSeek Harness的极简主义是故意的,而非不完整:@ZhihuFrontier放大的一篇详细文章,并由@TheTuringPost总结,将DeepSeek Harness (DSH)描述为名为Cordis的插件架构上的一个刻意薄壳。
关键设计选择是一切都是插件,包括智能体循环本身。据报道,早期beta用户在一周内发布了100多个插件并提交了400多个问题;示例范围从五子棋模型测试平台到数据库智能体,后者通过将模型连接到实时查询执行来闭合SQL反馈循环。
最有力的收获是架构性的:DSH与其说是“产品化助手”,不如说是开放智能体运行时,针对用户可扩展工具、可交换控制循环和业务规则注入进行了优化。
TrueFoundry开源了TrueForge,并明确了框架成本论点:@truefoundry、@omarsar0和@kimmonismus都报道了TrueForge的发布,这是一个MIT许可、可自托管、供应商中立的用于生产智能体的框架。
该栈包括工具编排、上下文管理、子智能体、代码沙箱、人工审批和追踪,支持本地和托管部署模式。
引起共鸣的技术主张是:在14项任务的企业基准测试中,TrueForge在Opus 4.8上匹配了Claude Managed Agents,同时使用的token减少约30%,而路由到GLM-5.2则在不牺牲准确性的情况下将成本降低约75%。
更广泛的行业主题——@bradenjhancock和@dbreunig通过@rseroter也呼应了这一点——是会话/环境/内存/工具层正成为差异化和节省的主要来源。
托管框架也获得了更清晰的观察性和控制:@ClaudeDevs增加了对自托管沙箱的内存支持、Web工具的域允许/阻止控制,以及重新设计的多智能体会话查看器,带有小地图、分组转录和每线程/会话成本。
与此同时,OpenAI继续推动相反的角度:为团队提供框架原语,嵌入到他们自己的产品中。@OpenAIDevs强调开源Codex框架是内部工具、运维仪表板和自定义应用之下的运行时,而@cursor_ai则围绕持久目标和长期会话发布了云智能体UX改进。
后训练、中期训练和RL系统工作:更多证据表明扩展正从参数转向训练配方质量:@kimmonismus提出了zAI/GLM创始人的一个显著主张:进步仍在扩展,但太多讨论集中在参数数量上,而不是数据质量、推理算力和后训练。
所引用的例子是……
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。