AI 见闻
精选· 重要性 4/5

Codex 6个月用户增长10倍达700万,是否已超越Claude Code?

Latent Space (Swyx)··约 8 分钟阅读
中文导读

OpenAI的Codex在6个月内用户增长超10倍,达到700万,而Claude Code用户数约200万。本文分析了Codex的增长趋势、与Claude Code的对比,以及AI编码代理领域的最新进展,包括Prime Intellect的Verifiers v1、编码代理基准测试和OpenAI的产品更新。

[AINews] Codex使用量6个月内增长超10倍,达到700万用户,过去一天增加100万;Codex是否超越了Claude Code?

平静的一天让我们对照Claude Code的沉默报道核实一些数字……祝贺Allen今天与Engram CEO Dan Biderman一起参加Latent Space Food Show下一集,也祝贺Prime Intellect团队估值达10亿美元、

ARR达1亿美元以及Verifiers v1的发布。今天相当平静,人们仍在深入消化上周多个前沿模型的发布。我们本想写“今天没什么大事”,但我们也有一个政策,即反复向你更新那些你真正应该关注的异常趋势。

在回顾下面的Reddit AINews汇总时,我们看到了之前错过的一条推文——GPT-5.6于7月9日发布。7月12日的推文称,他们在过去48小时(7月10-12日)内达到了600万用户。

然后24.5小时后,Tibo报告了700万用户……奇怪的是,这与Claude Fable订阅状态的意外延长同时发生(我们当然不知道两者是否相关,但永远在线的阴谋论者自然在建立联系)。

我们当然记得Fidji在3月份披露的200万Codex用户,这让我们可以更新AIE NYC 2025图表(下一个是AIE NYC 2026!

):相比之下,我们上次获得的关于Claude Code的更新大约是200万用户和2月份25亿美元的ARR(“自1月1日[六周前]以来,Claude Code的周活跃用户数量翻了一番。”)。

现在我们知道了Codex今年年初的情况(Fidji将1月1日的用户数定为约55万至70万),我们可以合理推断Codex遵循了类似的轨迹,今年迄今用户增长约10倍。

对Claude Code在报告方面相对沉默的善意解释是,他们几个月前将大部分编码工作转移到了Claude Tag,现在将用户集中在那里,鉴于Slackbot与CLI工具的可访问性不同,这将产生不同且难以比较的使用统计数据。

但6个月10倍的增长仍然是一个令人印象深刻的数字。AI新闻2026年7月11日至7月13日。我们检查了12个子版块、544个Twitter账号,没有进一步的Discord。AINews网站允许你搜索所有过往期刊。

提醒一下,AINews现在是Latent Space的一部分。你可以选择加入/退出邮件频率!

AI Twitter回顾智能体强化学习基础设施:Prime Intellect的Verifiers v1和长周期部署Prime Intellect发布了Verifiers v1,这是对其智能体强化学习和评估环境栈的重大重新设计。

关键抽象将环境拆分为任务集、工具集和运行时,明确支持跨异构执行环境的编码和计算机使用智能体的“自带工具”工作流,正如Johannes Hage及其后续深度分析所强调的那样。

团队成员将此次发布描述为数月的基础设施现代化工作,带来了重大效率提升,包括willccbb、mikasenghaas和xeophon的更丰富评论。

为什么它在技术上很重要:最重要的底层变化之一是,部署轨迹现在存储为消息DAG,因此每条消息只存储一次,而不是重复复制到完整历史中;据Prime Intellect称,这将轨迹增长从O(n²)转变为O(n),使得长周期多模态部署和路由器重放更加实用。

该团队还声称了一个具体的训练配置:一个100B推理模型,在40轮SWE智能体任务上,使用用户提供的编码工具,进行1000步RL,在2天内使用6个H200节点(willccbb)。

这一说法得到了vLLM生态系统支持,vLLM指出验证器的部署路径在vLLM上运行,使用精确的token ID/logprobs,以避免服务与训练之间的分词漂移。编码智能体、工具集设计和每任务成本竞争工具集正在成为产品表面:多篇文章一致认为模型质量不再是唯一的差异化因素;

工具集/编排器越来越决定结果。threepointone的演讲被总结为“工具集就是应用”,而LangChain则认为,获胜的智能体产品将来自任务专用的工具集,而非通用包装。

Factory通过“设计模式”推出了一个相关的UI角度,用户指向UI元素/文件,而不是口头重新指定编辑。在编排方面,omarsar0强调跨模型切换提供商,以对冲定价/政策波动。

基准测试正在从token价格转向每任务成本:skirano构建了一个编码智能体指数探索器,发现了显著的性价比权衡,例如Terra Max在分数上略领先于Fable 5 Max,而成本大幅降低;

而Cognition报告称,Devin Fusion现在使用Fable 5,令人惊讶的是,其每任务成本可能低于Opus 4.8,因为更强的委派和判断减少了不必要的工作。

imjaredz强调了这些实验的关键统计数据:在81%的Fable主导的运行中,主导模型从未进行代码编辑,这意味着昂贵的模型在避免浪费操作时可以更便宜。

现实世界的智能体基准测试越来越密集:Arena将GPT-5.6 Sol在其智能体排行榜上排在第2位,基于7800次现实世界智能体会话,具有强大的可操控性和任务成功率;随后,Arena将Grok-4.5排在第13位,相比Grok 4.3有显著提升。

Artificial Analysis也强调,每任务成本是长周期知识工作日益重要的指标,认为仅凭token定价会忽略轮次、冗长和缓存命中率的影响。

Parlance Labs的独立评估工作比较了自动评估平台和基础模型在生产语音智能体轨迹上的故障分析,而dair.ai则重点介绍了一篇关于CLI编码智能体故障剖析的论文,关注运行在何处变得不可恢复,而不仅仅是最终通过/失败。

OpenAI GPT-5.6 Sol、Codex使用修复和产品表面扩展OpenAI透明地解决了Codex/Sol使用量消耗问题:最大的操作线程来自thsottiaux,他解释了GPT-5.6 Sol在ChatGPT Work/Codex中的几个修复:

推理优化使使用量增加约10%,在计费/使用副作用后将上下文限制从372k回滚到272k,恢复了一些实验性的推理努力(“juice”)变化,并修复了高/极高设置下过度活跃的多智能体行为。

theo的社区逆向工程提出,长上下文、子智能体生成和快速模式等复合因素导致了严重的消耗,不过他后来在后续中纠正了一个计费细节。反应分为对所谓“削弱”叙事的批评(ns123abc)和对异常透明度的赞扬(theo, sama)。

用户报告了强大的编码/计算机使用能力:多位从业者认为OpenAI在编码模型方面已领先,包括schrockn,而gdb则反复展示了ChatGPT Work和Codex工作流,用于创业公司勘探、网页设计、移动工作和网站生成。

特别有说明性的用户演示包括Star_Knight12在Cursor中使用Sol设置Blender MCP,并在没有Blender经验的情况下渲染了一个浮动的MacBook;

以及petergostev展示GPT-5.6 Sol Ultra在SQL中构建了一个类似Doom的游戏。产品级扩展仍在继续:ChatGPTapp宣布ChatGPT在欧洲经济区重返WhatsApp,并在其他市场支持Kakao/Viber。

OpenAIDevs开放了OpenAI Build Week的提交。在整个OpenAI生态系统中,gdb简洁地总结了这一刻:“你可以直接创造东西。

”开放模型、推理系统和量化Transformers↔vLLM集成消除了重复的模型实现工作:Clement Delangue强调了一个重大的开放推理可用性改进:Hugging Face Transformers模型现在可以在vLLM中以原生速度运行,通常匹配或超过手写实现。

如果这一点广泛推广,将减轻长期存在的为每个新架构实现实现的负担。

原文出处
[AINews] Codex usage up >10x in 6 months to 7M users, +1M in the past ~day; did Codex overtake Claude Code??

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读