AI 见闻
精选· 重要性 5/5

SWE-1.7:以极低成本实现前沿智能的推理模型

Hacker News (AI)··mekpro·约 8 分钟阅读
社区热度 270
中文导读

Cognition 发布 SWE-1.7 模型,通过强化学习在多个集群上训练,以极低成本达到接近 GPT-5.5 和 Opus 的智能水平,挑战了“后训练天花板”的假设。

SWE-1.7:以极低成本实现前沿智能今天,我们发布 SWE-1.7,这是我们迄今为止训练过的最强大的模型。它以极低的成本达到前沿智能水平,推动了成本-性能帕累托曲线的进步。

SWE-1.7 是我们 RL 流水线全面改进的成果:更好的基础设施、更稳定的训练、更高质量的数据以及用于长周期任务的新技术。

由于 SWE-1.7 基于已经过广泛 RL 后训练的 Kimi K2.7 基座模型训练,我们训练带来的巨大额外收益挑战了“后训练天花板”的观点,表明 RL 可以将能力推至远超此前认为的水平。

在 Cognition,我们一直在制定和完善优秀智能体软件工程的原则,无论是在评估中(通过 FrontierCode1、2),还是在训练中(通过 SWE-1.7)。我们的模型特别针对更长周期的异步任务进行了优化,这是高质量软件工程的重要组成部分。

SWE-1.7 现已通过 Cerebras 以 1000 TPS 的速度在 Devin(Web、桌面和 CLI)中提供。我们鼓励您亲自尝试!本文的其余部分将介绍我们如何训练 SWE-1.7:模型背后的基础设施、算法和数据工作。

我们重点介绍四个重要组成部分。- 保持熵并稳定训练:长周期 RL 训练面临两个棘手问题:熵崩溃,以及训练与推理之间数值漂移导致的不稳定性。

我们逐一排查并解决了每个问题的根源,从而使训练能够持续改进,远超此前运行停滞的点。- 多集群训练与容错:RL 不需要将所有推理算力集中在一个集群中。我们在三大洲的集群上进行训练,通过对象存储传输权重更新,并构建了容错机制,使硬件故障永远不会导致训练中断。

- 策划高质量数据:我们构建了广泛的数据质量流水线,通过自动化执行测试运行每个任务,过滤掉学习信号低的任务,并强化任务以防止奖励作弊。- 长周期任务的自我压缩:模型学会总结其工作状态并从摘要中恢复,从而将任务周期扩展到原始上下文窗口之外。

我们使用交替长度惩罚来激励简洁输出,同时不牺牲正确性。最后,我们分享一些关于模型因训练设置而获得的趣味行为倾向的观察,例如仔细探索和简洁推理。保持熵并稳定训练我们发现训练稳定性是大规模可预测改进的关键因素。

在使用异步 RL3 进行训练时,我们遇到的最棘手问题之一是推理与训练之间的 KL 散度不匹配,因为训练器策略通常与采样策略不同。

过去,为了纠正这一点(尽管规模较小),我们使用了重要性采样5 和量化感知训练,用于 NVFP4 + 专家路由回放6,7 中的低精度 rollout。在此,我们介绍在更大规模下变得更加重要的额外干预措施。

我们发现 top-p 采样8 显著有助于防止熵崩溃9,10,即强模型在几百步内停止探索且奖励趋于平稳。极低概率的 token 通常是偏离轨道或分布外轨迹的一部分。

这些轨迹很可能产生低奖励,而 softmax 函数的性质导致这些 token 使 token 概率分布变得尖锐。实际上,假设我们有三个 token,其 logits 和概率分别为 ,其中 token 3 是导致低奖励的低概率 token。

如果我们采样 token 3,其 logprob 相对于 logits 的梯度为:而 logits 的策略梯度更新为 ,其中 是采样 token 的优势。由于该轨迹获得低奖励,且更新为在这些更新中, 受到惩罚, 增长超过 。

因此,采样扩大了已占主导地位的 token 的领先优势,使分布尖锐化并降低熵。Top-p 采样首先防止这些低概率 token 被采样并用作优化目标!这种保持熵的效果使得 top-p 采样在我们的 rollout 中是可取的。

但简单地实现 top-p 显然会增加训练与推理的不匹配——训练器计算所有 token 的概率,而 rollout 从 top-p 子集中采样,因此分布具有更高的散度,导致少量步骤后崩溃。

因此,我们实现了采样分布回放11,其中我们记录 rollout 时可用的 token 保留集,并在训练器中使用这些掩码重新归一化概率。通过这一修复,我们运行的熵在训练过程中大致保持不变,且推理-训练散度保持有界。

使用 top-p 采样回放的另一个有趣结果是仅针对概率低于阈值的 token。概率高于阈值的 token 的保留集大小为 1,因此其重新归一化的概率分布为常数 1,梯度被清零。

我们通过经验发现,模型采样的大部分 token 高于标准 top-p 阈值,因此它们被排除在整体梯度计算之外。这减少了梯度噪声,使优化算法能够专注于轨迹中高学习信号的 token。我们还发现使用 Muon 优化器12 和消除训练器中非确定性操作的好处。

多集群训练Cognition 是一个快速发展的研究实验室,进入了一个严重受算力限制的既定领域。

我们的目标是训练万亿参数模型,但如今,单个网络结构上拥有 10-100k 芯片的大型集群是稀缺资源。相比之下,如果正确使用,全球范围内的小型集群则很丰富。在这种情况下,RL 的结构对我们有利。

RL 自然地跨多个集群分解。只有训练器必须位于单个高带宽集群上。生成 rollout 的推理引擎是自包含的。它们可以在任何地方运行,除了当前权重外不需要任何东西。我们投资了利用这一特性的基础设施。

我们的 RL 训练跨越三大洲的四个数据中心,结合了我们自己跨多个集群的 GPU 以及来自 Fireworks 等推理提供商的额外算力。结果是,我们可以将 RL 训练扩展到远超任何单个集群所能允许的规模。

此设置的核心挑战是在每个优化器步骤后使所有推理引擎与训练器权重保持同步。我们希望这些权重更新快速,以减少轨迹的陈旧性,从而能够以更激进的学习率进行训练。简单地将完整模型从一个集群广播到另一个集群会缓慢且低效。

相反,每 K 个梯度步骤,我们计算并发送当前权重与之前权重之间的压缩权重增量,将每次传输的大小减少超过 99%13。

我们不是将权重直接从训练器流式传输到每个推理集群,而是使用云对象存储来维护权重版本的单一事实来源。训练器上传新的权重增量后,推理引擎几乎可以在不中断推理的情况下更新。每次训练运行在每个相关集群中都有一个权重控制器,管理运行的权重版本生命周期。

权重控制器轮询对象存储以获取新的清单,训练器在每次更新后写入这些清单。当发现新的增量时,它会指示工作节点下载其分片,然后通过树广播在本地磁盘上复制这些分片。相同的对象存储还将路由矩阵和 top-p 掩码从推理引擎传回训练器。

每个推理引擎

原文出处
SWE-1.7 Reach Near GPT 5.5 and Opus Intelligence

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读