AI 见闻
精选

[AINews] Claude Opus 5:以Opus价格获得晶圆厂级性能(半寓言)

Latent Space (Swyx)··约 8 分钟阅读

[AINews] Claude Opus 5:以Opus价格获得晶圆厂级性能(半寓言)在提炼寓言方面,没有人能比得上Anthropic!在周五罕见的发布中,《作品5》成为了今天的头条新闻。尽管其大部分官方基准显示它在技术上击败了Fable,但官方消息仍然表示它“接近”。

这主要反映了Evals的困难--今天的AIE曲目下降--没有反映Anthropic显然知道Fable保留但无法衡量的“大模特气味”。幸运的是,对Opus的独立评估证实了其出色表现:除了定价之外,效率的提高也很重要……尽管它仅与GPT 5相匹配。

6索尔:AI新闻2026年7月23日至2026年7月24日。我们检查了12个subreddits、544个Twitter用户,没有进一步的Discords。AINews的网站允许您搜索所有过去的问题。

提醒您的是,AINews现在是潜伏空间的一部分。您可以选择加入/退出电子邮件频率!

人工智能Twitter回顾头条新闻:Claude Opus 5模型发布发生了什么Anthropic的《Claude Opus 5》发布引发了基准审查、对编码代理的强烈赞扬以及关于前沿模型评估的新争论。

多条推文明确讨论了Claude Opus 5作为新推出的模型,并将其与其他前沿系统进行编码和通用能力指标的比较,包括Epoch的ECI评估、FrontierCode异常讨论以及用户对工具使用工作流程的早期反应,例如浏览器自动化@abacaj、@abacaj。

Epoch报道称,Claude Opus 5的ECI为159,“略低于Fable 5的161值”,而在软件工程基准@ EpochAiresResearch上,与SWE-ECI上的Fable 5为161。

ECI的结果立即招致了用户的批评,他们认为该分数低估了Opus 5的实际改进;一位回应称其“被极其低估”,并指出它似乎只比Opus 4好1个百分点。8尽管在实践中似乎“在各方面都做得更好”@scaling01。

同一用户主张更严格的公开基准@scaling01。另一个线程强调了一个明显的基准不规则性:Opus 5在FrontierCode上的中等努力下得分高于在较高努力下,尽管更多努力提高了其他evals @jerhadf的性能。

这表明要么是特定于任务的搜索/工作量权衡,要么是评估不稳定,而不是额外推理时计算的单调收益。几位懂技术的用户赞扬了Opus 5的编码性能。

米哈伊尔·帕拉欣(Mikhail Parakhin)@ MParakhin表示“n中最好的规则”,并报告说“在数学和一切方面”与寓言队取得了明显的正面交锋,同时希望它能在Codex中找到。

Arena宣传了对Opus 5的第一印象,并表示基于现实世界使用的排行榜评分很快就会在@arena上发布,这表明社区评价在发布时仍在迎头赶上。

Nous Research的门户网站增加了对该模型的访问,并在推特上表示用户可以通过Nous Portal直接使用Opus 5,并且20%的折扣适用于包括Opus 5@witcheer在内的所有模型。

这是分布/可用性,而不是能力声明。用户轶事强调浏览器控制/代理工具的使用。一个帖子说,Opus 5打开了浏览器,取消了ChatGPT Pro订阅@abacaj,随后是“这东西真的可以驱动浏览器哇”@abacaj。

这些都是孤立的演示,而不是系统性的评估,但它们与计算机使用代理的更广泛市场兴趣一致。

其他早期反应更多的是模因性而不是技术性的,包括“Opus 5地铁FPS结果”@bijanbowen、“On Claude bro”@andrew_n_carr和“他们害怕Anthropic”@ unces tax。

这些反映的是情绪,但不是证据。

技术细节时代能力指数(ECI):克劳德·作品5 ECI = 159寓言5 ECI = 161Claude Opus 5 SWE-ECI = 161,与软件工程上的Fable 5相匹配@ EpochAresearch社区回应指出,与Opus 4相比,

该模型似乎只有+1 ECI点。8,一些读者认为这相对于定性收益来说太小@scaling01,@scaling01。

FrontierCode行为:一位评估者指出,FrontierCode for Opus 5上的中等努力>高努力,尽管通常采用的改进模式是在其他地方付出更多努力@jerhadf。该推文在此摘录中没有提供原始数据,但核心技术点是,增加的努力并不一致有益。

轶事比较主张:在一名用户的测试中,与Fable取得了明显的正面交锋胜利,特别是在n中最佳抽样的情况下@MParakhin在一篇生态系统摘要帖子中匹配“神话”,但没有附加数字@eliebakouch事实与观点更多事实/以测量为导向的主张Epoch的基准声明称,

Opus 5的ECI评分为159分,SWE-ECI评分为161分,这是@ EpochAiresResearch中最明确的经验主张。Arena关于第一印象可用且现实世界排行榜分数即将公布的声明是事实,但不完整@arena。

Nous Portal以20%的折扣提供Opus 5的访问权限是产品可用性事实@witcheer。解释/意见“ECI被低估了”和“我们需要更严格的公共基准”是关于基准有效性和敏感性的观点@scaling01,@scaling01。

“如何动摇对任何基准的信心:显示Anthropic在它上做了一些事情”是对基准话语和社区偏见的修辞怀疑@ cares taxesTex。“n中最好的规则”和Opus是对寓言的“非常明显的赢家”是非正式的从业者判断,有用但不标准化@MParakhin。

“他们害怕Anthropic”和与Anthropic相关的AGI时间线猜测纯粹是观点/猜测,而不是发布证据@ cares taxesTex、@ cares taxesTex。

不同意见支持性观点最强烈的积极解释是,Opus 5在实际使用中比目前显示的公共汇总基准更强,特别是对于编码和工具使用任务。@MParakhin报告说,它在他自己的测试中击败了Fable,并表示n中三胜制可以改善结果。

@abacaj、@abacaj强调有效的浏览器自动化,建议实用的代理能力。@bijanbowen称“地铁FPS结果”是迄今为止最好的结果,这意味着视觉/计算机使用演示的质量给观众留下了深刻的印象。

@eliebakouch将《Opus 5》列为顶级封闭模型版本之一,并表示它“符合神话”,将其定位为顶级前沿进入者。怀疑/批评观点主要的批评不是Opus 5薄弱,而是围绕它的基准测试不稳定、未指定或与用户印象不一致。

@jerhadf指出了一项令人困惑的缩小FrontierCode上的不一致性的努力。@scaling01认为,相对于观察到的改进,ECI结果似乎太低,并利用这一结果呼吁制定更严格的公共基准@scaling01。

@ cares taxesTex暗示一些基准信任是偶然的,人类特定的结果会引发基准批评,i. e.社会解释可能会污染技术评估。中立/分析观点Epoch的框架受到限制:总体略低于Fable,取决于SWE特定功能@EpochAiresearch。

Arena的“第一印象现在,现实世界排行榜以后”是另一种中立姿态,实际上是在表示社区尚未在@arena上达成强有力的排名。

上下文克劳德家族模型已经以强大的编码性能、长上下文实用性和相对精致的企业/产品包装而闻名,因此Opus 5进入了一个用户准备测试Anthropic是否可以保持或扩展编码领先地位的市场。

此次发布正值从静态聊天基准向代理评估的更广泛转变:浏览器使用、工具调用、并行任务执行和软件工程循环完成。这就是为什么即使是浏览器取消工作流程等随意的轶事也会引起关注--它们映射到经典QA基准所错过的现实世界能力类别。

围绕Opus 5的基准摩擦符合一个更广泛的生态系统问题:总能力分数通常将不同的行为压缩为一个数字。ECI和类似的指数对于广泛跟踪很有用,但一位数摘要

原文出处
[AINews] Claude Opus 5: Fable-level performance at Opus price (half Fable)

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。