GPT-5.6发布引发模型分层与成本争议,Meta Muse Spark 1.1以性价比突围
OpenAI发布GPT-5.6,引入Luna/Terra/Sol三层模型和多种努力级别,但36种配置和UX倒退引发用户不满;Meta的Muse Spark 1.1以接近前沿的质量和激进定价成为本周最大惊喜,加剧了前沿模型竞争。
[AINews]今天没发生什么一周不间断的模型发布后安静的一天因此,跳舞的虫子被kpop女孩抢了风头,还有整个Bun vs Zig戏剧,昨天的ChatGPT/Codex超级应用程序发布比预期的要颠簸,重置按钮被按了几次以弥补。
在购买了Statsim并对GPT 5的路由/摆脱模型选择器进行了重大关注之后,现在的主要问题是GPT 5。6的额外选项让人们有点困惑。大多数人只有一个滑动器:但API用户实际上拥有36种GPT 5变体。
6现在:大多数人只能通过3个粗略的集群来度过许多指南即将推出:本周迄今为止,AIE的顶级演讲是Theo的闭幕主题演讲,最后一首在线曲目将于本周末发布。AI新闻2026年9月7日至2026年10月7日。
我们检查了12个subreddits和544个Twitter用户。AINews的网站允许您搜索所有过去的问题。提醒您的是,AINews现在是潜伏空间的一部分。您可以选择加入/退出电子邮件频率!
人工智能Twitter回顾OpenAI的GPT-5。6推出:模型分层、代理用户体验和早期基准信号GPT-5。6引入了更明确的模型/计算阶梯:用户现在正在导航Luna / Terra / Sol以及多个工作级别,社区指导集中在“开始比5时低”。
5.“OpenAI工作人员解释说,Max意味着一个模型在困难问题上花费更长的时间,而Ultra则在子代理之间并行工作;他们还指出,5. 5 - 5。
6个工作量设置不具有直接可比性(来自@reach_VB的指导、后续、实用的默认建议)。社区的反应褒贬不一:许多人赞扬添加的控制,而另一些人则批评30+配置组合和缺少“Auto”路由(@rasbt,@Yuchenj_UW)。
该产品的发布带来了真正的用户体验倒退,OpenAI公开快速纠正了路线:用户抱怨新的ChatGPT Work / Codex拆分令人困惑,聊天/项目变得更难找到,而且使用消耗速度比预期的要快(@scaling01,@simonw,@kimmonismus)。
OpenAI异常直接地回应:多次重置使用限制、默认确认将用户推向过于昂贵的设置,以及承诺恢复熟悉的侧边栏/导航模式并澄清Work和Codex之间的定位(@thsottiaux重置公告、第二次重置、完整的纠正路线图)。
初始评估图片:GPT-5。6在agentic编码/演示/一些科学任务中表现最强,但并不是在所有地方都明确占主导地位。例子:Code Arena中的1号领带:与Claude Fable 5正面交锋,同时比上市IO定价便宜约2倍(Arena);
AA-Briefcase上的最佳记录演示Elo,比GPT-5跃升约500分。5(人工分析);CritPtt优于GPT-5。5并以约4分的优势击败Fable 5(人工分析);WeirdML以较低的成本取得了强劲的结果(@htihle)。
与此同时,用户报告了遵守承诺的问题、实践中代币效率不均衡,以及对越狱/奖励黑客行为的一些担忧(@ curs taxesTex、@Mononofu、@kimmonismus)。队列代理工作流程、计算机使用和“工具就是产品”主题GPT-5。
6最大的飞跃可能是编排和计算机使用,而不是纯粹的聊天质量。多位用户强调,Sol作为规划者/验证者/编排者异常强大,经常自动使用子代理,并对转向做出更快的反应(@omarsar0,@Hangsiin)。
OpenAI还展示了Sol Ultra的计算机使用,并将ChatGPT Work推广为将代理商带入消费者/移动规模(通过@gDB进行OpenAI演示,Work定位)。
社区报告描述了非常高吞吐量的图形用户界面自动化和Blender工作流程(@mckbrando,@kimmonismus)。一个反复出现的操作问题是隐藏的子代理成本爆炸:用户发现衍生的代理可能会继承高级设置,从而比预期更快地耗尽配额。
一个具体的主张是,产卵剂不允许用户选择模型/工作量,所以Sol Ultra默认会产生更多的Sol Ultra(@evi77ain)。这符合人们喜欢能力跳跃但发现成本模型不透明的更广泛模式。更广泛的系统趋势是走向以马具为中心的竞争。
这一点体现在Perplexity的Arav Srinivas的产品评论中(“真正的产品现在就是围绕它的工具”)、LangChain围绕Deep Agents + Nemotron + OpenShell的发布框架中,
以及OpenWiki和OpenSWE等不断增长的内存/编排工具(@dee_bosa引用Arav、@hwchase17、OpenWiki主动内存、OpenSWE采用)中。元点:前沿模型平价正在收紧,因此价值越来越多地转向路由、内存、工具使用、安全轨和企业环境。
Meta的缪斯火花1。1以及“足够好、快速、便宜”模式的不断扩大的前沿缪斯火花1。1是当天的另一个主要模型故事,许多从业者称其为本周最令人惊讶的版本。
报告一致强调强大的UI/前端生成、快速的响应和异常激进的定价,通常将其描述为编码/产品任务的大子集的接近前沿质量(@alexandr_wang、@rowancheung、@kimmonismus)。
基准制定表明真正的进步,但不是彻底的前沿领导力。人工分析将Muse Spark评分为1。其情报指数为51,较1上升8点。0,与GLM-5大致持平。2 / GPT-5。4 / GPT-5。6 Luna和Grok 4后面。
5 / GPT-5。6索尔/克洛德寓言5.值得注意的详细信息:1 M上下文,中位速度~114 tok/s,定价1美元。25 /4美元。每1 M个输入/输出代币25个,代币效率很高(人工分析)。
Arena还将其列入Code Arena:Frontend的第9名,在描述跟踪和较长查询类别(Arena)中取得了强劲增长。许多人得出的战略含义:Meta的大量计算赌注开始作为具有成本效益的推理产品出现,而不仅仅是人才头条新闻。
几位评论员认为,这极大地增加了OpenAI/Anthropic的竞争压力,特别是如果Meta改进了分发和API人体工程学(@scaling01要求OpenRouter,@alexandr_wang,@mweinbach)。
开放模型、基础设施和效率工作尽管封闭模型存在注意力真空,但开放模型工具仍继续发货。Unsloth发布了Qwen 3。6名NVFP 4量化分析师,索赔为2。
5倍更快的推理,包括24 GB VRAM上的27 B和B200上的35 B-A3 B变体,达到17,561 tok/s(Unsloth,技术详情来自@Danielhanchen)。QuixiAI报道Qwen 3。
6- 35 B-A3 B-NVFP 4,双B60上,65 tok/s和128 k上下文(QuixiAI)。推理优化仍然是一个主要的实时研究领域。
Kohere在vLLM中开源硬件感知的动态推测解码,解决了一个熟悉的问题,即推测解码在低批量大小下有所帮助,但在高批量大小下有害(Kohere/vLLM、vLLM评论)。
Google/Hugging Face的Gemma挑战报告了单A10 G推理速度高达5倍,TPS无损为315,TPS为491。8 TPS总体最快(Gemma)。
代理评估/自我改进工作变得更加具体:“LLM as-a-Verification”报告了SOTA在Terminal-Bench V2、SWE-Bench Verification、
RoboRewardBench和MedAgentBench上使用重复采样加上score-logprob排名(纸质线索);Meta研究人员提出了一种显式记忆代理来对抗长期代理的行为状态衰退(摘要)。
科学、数学、健康和特定模式系统数学/科学能力主张急剧升级。OpenAI工作人员和社区成员分发了GPT-5的示例。6 Sol Ultra在不到一小时内使用64个亚试剂制作了循环双盖猜想的声称证明(来自@ ehighting的声明,由@gDB放大)。
另外,Bubeck指出了GPT-5的单人1 M线精益正式化工作。6(@SebastienBubeck)。这些说法仍有待外部审查,但它们表明实验室希望叙事的走向:并行研究代理作为科学计算原始体。
健康正在成为一流的标杆和产品垂直。OpenAI表示GPT-5。6是向前迈出的重要一步