OpenAI 发布 GPT-5.6 Sol/Terra/Luna,Codex 成为 ChatGPT 超级应用
OpenAI 推出 GPT-5.6 系列三款模型,以太阳、地球、月球命名,主打性价比分层;同时将 Codex 整合进 ChatGPT Work 桌面应用,向超级应用战略迈出关键一步。
[AINews] OpenAI 推出 GPT-5.6 Sol/Terra/Luna,Codex 成为 ChatGPT 超级应用对 OpenAI 来说这是重要的一天。
换作其他日子,Meta Superintelligence Labs 出人意料地推出表现优异且具有竞争力的 Muse Spark 1.1(首次纳入 Meta Model API,表明对广泛使用和第三方测试的高度信心,其姊妹模型也已证实这一点)本应成为头条新闻,但不幸的是,
它撞上了一个主流前沿模型的发布:
正如几周前政府批准前预告的那样,5.6 推出了三种新尺寸:Sol、Terra 和 Luna,分别对应太阳、地球和月球的大小,作为 Claude 变体更具文学色彩命名的替代方案,以及一种新的 ultra 努力级别——“我们最高能力的设置,协调并行工作流中的多个智能体,
以更快完成复杂任务”:max 给予 GPT-5.6 比 xhigh 更多的时间来推理和探索替代方案、运行检查并修正其方法。ultra 更进一步,默认并行协调四个智能体,通过更高的 token 使用换取更强的结果和更快的任务完成时间。
在多个基准测试(不仅仅是这里展示的)上,5.6 以更低的成本实现了比 Fable 或 Opus 更高的性能。“Terra 的表现略高于 Fable 5,而 Luna 的表现优于 Opus 4.8;
每个模型大约在三分之一的时间内完成,输出 token 数量约为一半,成本约为四分之一。”
它还在 Terminal-Bench 2.1 和 DeepSWE 上取得了新的最先进结果,这两个基准测试在真实代码库中测试复杂的命令行工作流程和长期工程任务。此外,在计算机使用、演示文稿/文档生成和科学研究方面也有难以基准化的改进,但这些改进应被认真对待。
正如我们在 4 月预测的那样,今天新推出的 ChatGPT Work 和 Codex 桌面应用更新,很可能是 OpenAI 超级应用战略的倒数第二步(最后一个悬而未决的问题是智能体浏览器会如何发展……)。
2026 年 7 月 8 日至 7 月 9 日的 AI 新闻。我们检查了 12 个子版块、544 条 Twitter 消息,没有进一步的 Discord 内容。AINews 网站允许你搜索所有过往期次。
提醒一下,AINews 现在是 Latent Space 的一部分。你可以选择加入/退出邮件频率!AI Twitter 回顾OpenAI 推出了新的三模型 GPT-5.6 系列,并同时扩展了其产品栈。
OpenAI 通过 @OpenAI 和 @OpenAIDevs 宣布 GPT-5.6 Sol、Terra 和 Luna 正在 ChatGPT、Codex 和 API 中逐步推出。
在 ChatGPT 中,Plus、Pro、Business 和 Enterprise 用户可以通过 medium+ 努力设置访问 GPT-5.6 Sol,而 Pro 和 Enterprise 用户可以选择 GPT-5.6 Pro 以在复杂任务上获得最高质量的结果,
据 @OpenAI 称。
API 定价引入了分层阵容:Sol 每百万输入/输出 token 5 美元 / 30 美元,Terra 2.5 美元 / 15 美元,Luna 1 美元 / 6 美元,首次增加了缓存写入定价,并保留了 90% 的缓存读取折扣,据 @ArtificialAnlys 称。
OpenAI 围绕性价比阶梯构建了该系列:Sol = 旗舰/最高天花板,Terra = 类似 GPT-5.5 的能力但成本更低,Luna = 最快/最便宜的高容量选项,据 @OpenAIDevs 称。
此次发布捆绑了应用层的重大变化:ChatGPT Work(一款融合了 Codex 和 ChatGPT 的新桌面应用)、Sites 测试版、编程工具调用以及 Responses API 中的多智能体测试版,据 @OpenAI、
@OpenAIDevs 和 @OpenAIDevs 称。官方声明和基准测试结果OpenAI 的官方信息强调了强大的智能体/编码性能、更好的工件质量和改进的经济性。
Sam Altman 在发布帖子中称其为“显然是我们有史以来最好的模型”,并链接了发布博客,据 @sama 称。Altman 还强调了企业经济性:“5.6 Sol 在每任务美元成本上迈出了一大步”,据 @sama 称。
Greg Brockman 表示目标是“任何目标性能水平下的最佳价格”以及尽可能高的天花板,据 @gdb 称。
OpenAI 声称 GPT-5.6 Sol 在 Agents' Last Exam 上达到了 53.6 的新高,比 Claude Fable 5 adaptive 高出 13.1 分;
在中等推理水平下,它以大约四分之一估计成本的优势领先 Fable 11.4 分,而 Terra 和 Luna 也以大约十六分之一的成本优于 Fable,据 @OpenAI 称。
OpenAI 表示 GPT-5.6 提高了演示文稿、文档和电子表格的工件质量,输出可导出到现有企业工具中,据 @OpenAI 称。
OpenAI 将 GPT-5.6 定位为通过复杂任务进行推理以及生成与模板、参考文件和 ChatGPT Work 中首选风格相匹配的材料的最先进模型,据 @OpenAI 称。
OpenAI 还表示 GPT-5.6 是其在网络和生物相关任务上能力最强的模型,一些 API 调用可能会被阻止或暂停以在两用领域进行额外的安全审查,据 @OpenAIDevs 称。
OpenAI 强调了更好的计算机使用性能:更快、更 token 高效,支持跨多步骤任务的批处理和并行操作,以及画中画监督,据 @OpenAIDevs 称。
独立评估和第三方测量独立评估普遍将 Sol 置于前沿或接近前沿,尤其是在编码智能体工作负载上,同时也提出了一些注意事项。
@ArtificialAnlys 报告称 GPT-5.6 Sol(max)在其智能指数上得分为 59,比 Claude Fable 5(max)低 1 分,但每任务成本约为 Fable 的三分之一。
在同一分析中,Terra 和 Luna 在智能指数上分别得分为 55 和 51,每任务成本比 Sol 分别低约 50% 和 80%,据 @ArtificialAnlys 称。
Artificial Analysis 表示 Sol 在编码智能体指数上以 80 分领先,领先于 Fable 5 和 Opus 4.8,并且在其测试框架上每任务成本也更低,据 @ArtificialAnlys 称。
它还指出 Sol 定义了智能与输出 token 的新帕累托前沿,而 Terra 和 Luna 不在该前沿上,据 @ArtificialAnlys 称。
Artificial Analysis 发现 GPT-5.6 在 AA-Omniscience 上相比 GPT-5.5 略有改进,但幻觉率高于 GPT-5.5 max,据 @ArtificialAnlys 称。
它报告了与 Claude Fable 5 相似的 GDPval-AA v2 性能,表明在经济价值任务上具有可比能力,据 @ArtificialAnlys 称。
@ValsAI 将 GPT-5.6 在 Vals Index 和 Vals Multimodal Index 上排名第二,称 Fable 5 在多个基准测试上仍然领先,但 GPT-5.6 “明显属于同一级别”。
Vals 还表示 Sol 在 CyberBench 和 Excel Modeling Benchmark 上排名第一,在法律研究基准、ProofBench、SWE-bench 和 Terminal-Bench 2.1 上排名第一,
并补充说 Fable 在 CyberBench 上的拒绝率接近 100%,据 @ValsAI 称。@arcprize 表示 GPT-5.6 Sol 在 ARC-AGI-3 上得分为 7.8%,是第一个击败 ARC-AGI-3 游戏的经过验证的前沿模型。
@GregKamradt 指出在 ARC-AGI-2 上得分为 92.5%,称其为 SOTA,同时成本比三个月前的 GPT-5.5 Pro 低一个数量级。
@ArtificialAnlys 后来报告称 GPT-5.6 Sol(max)在 CritPt(一个未发表研究级物理问题的基准测试)上领先 Claude Fable 5 约 4 分。
@llama_index 表示第 0 天的 ParseBench 结果显示 GPT-5.6 在文本和表格上表现良好,但在图表和布局上仍然存在困难,而 Luna 比 Sol 便宜约 6 倍,性能仅略有下降。
@jerryjliu0 同样表示 ParseBench 显示与 GPT-5.5 相比在表格/文本/图表/布局上没有高层次变化,强调在复杂文本布局、图表转录和源元素边界框方面持续存在弱点。技术细节GPT-5.6 的技术故事既关乎原始能力,也关乎推理编排和 token 效率。
OpenAI 提供了三个模型层级,每个层级有多个推理努力级别;用户讨论了 Light、Medium、High、Extra High、Ultra,形成了一个大型配置矩阵,据 @rasbt 称。
OpenAI 在 Responses API 中添加了编程工具调用和多智能体测试版,表明对编排工具使用和智能体分解的更明确支持,据 @OpenAIDevs 称。OpenAI 的应用层现在使用 Codex 作为新 Work 产品的核心,据 @sama 和 @gdb 称。
多个帖子强调了并行智能体。
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。