Fable 5 发布与开放权重模型竞争加剧:AI 领域最新动态
本期 AINews 聚焦 Fable 5 模型发布后的使用指南与社区反应,同时报道腾讯 Hy3 开放权重模型、智能体基准测试、Anthropic 可解释性研究及推理效率进展,展现 AI 领域在模型能力、部署与安全方面的快速演进。
[AINews] 寓言实地指南平静的一天让我们消化了迄今为止世界上最重要的模型发布。在我们祝贺(节目之友!)General Intuition 发布新模型和(节目之友!)Shunyu Yao 发布新模型的同时,世界也在等待 GPT-5.6 Sol Ultra 的发布。
人们正竞相在明天订阅补贴结束前找到 Fable 5 的极限。
Thariq 一直在撰写“寓言实地指南”博客系列,碰巧在重新发布当天安排了一场主题演讲,于是他好心地在一夜之间调整了整个演讲,给出了他所能提供的最及时的建议,并于今天发布:4 个部分(我的同步评论以斜体表示):0:00 引言与 Fable 舞台搭建2:
32 解开 Claude 的束缚:理解模型行为模型的限制往往是由我们施加的——“我们给它们套上的缰绳,以及我们提示它们的方式”。因此,当我们遇到新一类模型时,我们应该预期移除或更改这些缰绳和提示,以引出你原本永远看不到的新行为,因为你过度限制了(即束缚了)模型。
一个典型的例子:大多数人已经同意 Thariq 关于 HTML 不合理有效性的观点。9:08 寻找未知:弥合地图与领土之间的差距这与“解开束缚”密切相关——如果解开束缚是关于清除过时的已知,那么这就是关于找到你甚至不知道自己不知道的东西。
最简单的技巧:告诉 Claude 为你的未知进行“盲点检查”集思广益“截然不同的设计方向”采访我——类似于 /grill-me,但优先考虑高影响力问题使用参考:在迁移的情况下保留 implementation-notes.md:
一个代表你做出的未指定决策的运行日志考考我——确保我的理解14:29 应对失落:反思编码生产力的情感转变你过去花数周完成的事情现在只需数小时16:30 不讲理:要求又好又快又便宜的结果“权衡并不真实”——因为 Fable 能力更强,你可以更有雄心,不接受权衡。
“构建很容易,创造价值仍然很难”。总体而言,这是一场精彩的演讲,随着世界适应第一批 Fable 级模型,我们将阐述其影响。AI 新闻 2026/4/7 - 2026/6/7。我们检查了 12 个子版块、544 条推特,没有更多 Discord。
AINews 网站允许你搜索所有过往期刊。提醒一下,AINews 现在是 Latent Space 的一部分。你可以选择接收/不接收邮件频率!
AI 推特回顾腾讯混元 Hy3 发布与开放权重前沿Hy3 作为一款严肃的开放模型登场:腾讯以 Apache 2.0 协议发布了 Hy3,这是一个 295B 的 MoE 模型,拥有 21B 活跃参数、192 个专家/前 8 路由、GQA、256K 上下文,
以及用于推测解码的 3.8B MTP 层。
多个帖子将其描述为在推理、编码和智能体任务上与更大的系统具有竞争力,特别强调了可靠性改进,如工具调用稳定性和反幻觉工作 @eliebakouch, @HuggingPapers, @ShunyuYao12。
推理支持异常成熟:@vllm_project 表示 Hy3 从发布之日起就在 vLLM 中原生运行,支持工具调用和推理解析器、MTP 推测解码,并在 NVIDIA 和 AMD 上得到验证。
后续详细说明腾讯生产内核现已上游至 vLLM 主分支,包括负载均衡解码调度和融合 FP8 MoE 服务,据报道在混合长度解码上性能提升高达 2.95 倍,与默认后端相比,TTFT 延迟降低约 24%,TPOT 降低约 17% @vllm_project。
社区反应强烈,@Teknium 迅速在 Nous Portal 上免费提供 Hy3 两周。
更广泛的开放模型背景:Hy3 立即与 GLM-5.2 进行了比较,一些发帖者认为,如果基准测试和实际体验结果成立,腾讯现已加入开源实验室的顶级行列 @teortaxesTex,而其他人仍认为 GLM-5.2 是目前实际可用的最佳开放权重模型 @tinygrad,
@mbusigin。总体结论:开放前沿正在快速压缩,竞争越来越关乎部署稳健性,而不仅仅是原始排行榜的差异。
智能体基准测试、框架与长期记忆AutomationBench-AA 增加了更现实的智能体评估:@ArtificialAnlys 为 Zapier 的 AutomationBench 推出了独立排行榜,在 657 个任务和 40 个模拟 SaaS 应用中评估智能体,
同时包含目标和护栏。Claude Fable 5 以 48.6% 领先,略高于 Opus 4.8 的 48.5%,Gemini 3.5 Flash 为 42.6%,GPT-5.5 xhigh 为 42.1%。
比排名更有趣的是:每个模型仍然违反业务规则,而 Gemini 在每护栏违规的目标达成率和成本效率上表现尤为突出。开放权重仍然明显落后,GLM-5.2 max 是表现最好的开放模型,为 27.8%。
能力指数正变得多维:Artificial Analysis 还引入了六个领域特定指数——金融与会计、法律、医疗保健、战略与运营、工程、经济——以超越单一标量模型分数 @ArtificialAnlys。
标题很熟悉——Claude Fable 5 加上 Opus 4.8 后备领先——但更有用的见解是排名按领域重新洗牌的剧烈程度,以及性价比前沿变得多么陡峭。这与 @fchollet 的观点一致,他认为报告基准分数而不考虑每个任务的成本越来越没有意义。
记忆和检索仍然是持久智能体的瓶颈:两篇论文在此受到关注。
首先,A-TMA 解决了“幽灵记忆”问题,即长期运行的助手中陈旧和当前事实被一起检索;在 LTP 基准测试上,将其添加到 Graphiti 据说能将冲突准确率提高 +0.240 绝对值 @omarsar0。
其次,ReContext 是一种无需训练的长上下文推理框架,在答案生成前重放模型内部证据,提高了八个 128K 数据集上的证据利用率 @dair_ai。
结合用于百万 token 上下文检索的 BlockSearch @dair_ai,主题很明确:更好的记忆行为越来越多地在推理时通过工程手段实现,而不仅仅是训练得来。
Anthropic 的 J-Space / 全局工作空间结果机械可解释性成为焦点:Anthropic 发布研究声称 Claude 具有类似全局工作空间的内部结构,以他们称为 J-space 的一小部分激活为中心 @AnthropicAI, @AnthropicAI。
核心主张不是思维链提取,而是识别出一个特权内部表征基底,该基底似乎可用于报告、调制和灵活推理。Anthropic 还为开放权重模型发布了 Neuronpedia 演示 @AnthropicAI。
研究人员为何关注:可解释性研究者认为这是比以往公开工作更强的模型“工作记忆”或内部工作空间的证据,即使他们不同意其框架。@NeelNanda5 称其为工作记忆类机制迄今最好的证据。
@Jack_W_Lindsey 认为理解这个特权空间可能是 LLM 认知的关键。帖子还强调了实际安全角度:据报道,该工作空间可以揭示隐藏概念、检测提示注入,并在口头表达之前暴露内部破坏相关特征 @mlpowered, @LiorOnAI, @omarsar0。
但“意识”语言受到了质疑:Anthropic 的公开框架引发了强烈反对。支持者表示,结果表明的是访问意识的功能类比,而非现象意识 @BorisMPower,而批评者则认为该公司将特权潜在激活与意识混为一谈,属于过度宣称 @AlanCowen。
即使是一些同情的观点也强调,更大的故事是审计和引导模型的新干预点,而非哲学。推理、服务与系统效率推测解码仍然是热门基础设施:@lmsysorg 添加了 DSpar