开放权重争议不断,Kimi K3 成焦点
本周 AI 圈围绕开放权重的争论激烈,但实际发布开放权重的只有 Moonshot AI 的 Kimi K3,该模型在多项基准测试中表现优异,引发广泛关注。
[AINews] 开放权重风波不断每个人都在高谈阔论,但今天只有 Kimi K3 真正发布。向大家介绍我们的新任编辑主管理查德·麦克马纳斯!当前关于开放权重的辩论,本质上是在一个话题上制造大量哗众取宠的言论,而真正决定走向的只有少数参与者(无论朝哪个方向);
这对于我们这些试图聚焦高信噪比信息的人来说并不有利。首先,由 NVIDIA 和微软签署的开放模型公开信迅速沦为表情包狂欢,生态系统中所有明显受益于更开放模型的人都纷纷联署,采取了一种早已民粹化的立场。
与此同时,OpenAI 起初被传未签署,随后又签署了,而 Anthropic 则未签署。这一切都在意料之中,也令人疲惫。与此同时,本周唯一真正发布开放权重的公司很可能是 Moonshot AI,他们本周末兑现了发布 Kimi K3 的承诺。
该模型已多次独立验证,如预期般击败了 Opus 4.8,从而赢得了全球最佳开放权重模型的称号。如果你不制定法律、不制造芯片、也不构建模型,我们建议你阅读 Kimi K3 的技术报告,而不是看评论家对大众发布的 50 条低困惑度的谩骂。
AI 新闻,2026 年 7 月 25 日至 7 月 27 日。我们检查了 12 个子版块、544 个 Twitter 账号,未发现更多 Discord 内容。
AINews 网站可搜索所有过往期次。提醒一下,AINews 现为 Latent Space 的一部分。你可以选择接收或退订邮件!
AI Twitter 回顾Moonshot 的 Kimi K3 开放权重发布与新的 3T 级开放前沿Kimi K3 是当天最重要的发布:Moonshot 发布了 Kimi K3 的权重、技术报告及配套基础设施,作为一个开放权重包:一个 2.8T 参数的 MoE 模型,
104B 活跃参数,896 个专家 / 每个 token 激活 16 个,1M token 上下文窗口,以及原生视觉理解能力(@Kimi_Moonshot)。
配套文章还通过 FlashKDA、MoonEP 和 AgentENV 开源了 FlashKDA(他们的 Kimi Delta Attention 内核)、MoonEP(MoE 通信库)和 AgentENV(分布式智能体环境基础设施)。
这不仅仅是模型发布,更是一套完整的大规模智能体后训练和服务的方案。
技术报告似乎与模型本身同等重要:多位从业者强调,K3 报告称相比 K2 实现了约 2.5 倍的扩展效率提升,其架构和训练选择聚焦于极端规模下的数值稳定性——参见 @eliebakouch、@suchenzang 和 @teortaxesTex 的反应。
评论中浮现的具体细节包括:MXFP4 权重 / MXFP8 激活(@teortaxesTex),为稳定性从头联合训练视觉编码器(@iScienceLuvr),以及对 MoE 路由 / 信号传播问题的高度关注。
据报道,该报告省略了总训练 token 数,多位读者指出这是一个有意义的缺失细节(@teortaxesTex)。许可协议为“开放权重”,而非宽松的开源许可:该模型可广泛使用,但并非 MIT/Apache 风格的开源。
多个帖子指出了商业使用限制:年收入超过 2000 万美元的大型托管提供商需要单独协议,月活超过 1 亿或月收入超过 2000 万美元的产品必须在 UI 中显示“Kimi K3”(@natolambert、@petergostev、@ArtificialAnlys)。
这为前沿“开放”可能走向何方提供了有用信号:源码可用 / 开放权重,附带商业例外,而非 OSI 风格的许可。
分发迅速且广泛:K3 在发布当天即可通过 vLLM(@vllm_project)、Baseten(@baseten)、Modal(@modal)、Fireworks(@Kimi_Moonshot)、Nebius(@Kimi_Moonshot)、
Together(@Kimi_Moonshot)、
DigitalOcean(@Kimi_Moonshot)、Cursor(@cursor_ai)、Cognition/Devin(@cognition)、Ollama Cloud(@ollama)和 Dell Enterprise Hub(@jeffboudier)使用。
这种广度凸显了开放权重前沿模型的发布现在已成为供应链事件,而不仅仅是研究公告。
开放 AI 安全、开放权重政治与 Anthropic 的立场NVIDIA 正式启动开放安全 AI 联盟:Jensen Huang 直截了当地阐述了核心论点:攻击者已拥有强大的 AI,因此防御者需要一个涵盖开放和封闭前沿模型以及共享工具和研究的生态系统。
旗舰声明来自 @JensenHuang,NVIDIA 在 @nvidia 正式宣布。
消息中技术上最有趣的细节是声称,在 OpenAI/Hugging Face 事件期间,一个前沿开放权重模型帮助遏制了入侵,而一个封闭模型则阻碍了关键取证——@AndrewYNg 和 @ZixuanLi_ 对此表示赞同。
该联盟迅速积累了可靠的基础设施和工具成员:已确认公开参与的成员包括 Hugging Face(@huggingface)、LangChain(@LangChain)、Nous Research(@NousResearch),以及来自开放生态系统的支持声音,
如 @UnslothAI 和 @Yuchenj_UW。其论点并非“开放自动更安全”,而是防御能力和可审计性需要开放访问模型、工具和轨迹。
Anthropic 最终澄清了其开放权重立场:在因未签署 NVIDIA 的开放权重公开信而持续受到批评后,Anthropic 发布了一份立场声明,称其“从未主张禁止开放权重模型”,而是支持:对中国的芯片管制、反工业规模蒸馏措施,
以及对足够能力的模型(无论开放还是封闭)进行强制性安全测试(@AnthropicAI)。反应分为“合理澄清”(@signulll)、“很好,但仍试图减缓前沿扩散”(@jachiam0),以及来自开放权重倡导者如 @Teknium 的更具敌意的解读。
围绕发布前审查的政策压力正在加剧:另一篇报道称,美国政府可能寻求对前沿系统进行长达 30 天的发布前访问,供 NSA 和 CAISI 等机构评估,开放与封闭的处理方式仍未解决(@kimmonismus、@leomschwartz)。
结合 Anthropic 的声明和 OpenAI 在华盛顿的简报,方向很明确:前沿模型发布正在成为一种治理接口,而不仅仅是产品发布。
基准测试、评估与智能体可靠性K3 的早期评估结果强劲,尤其是在智能体/编码方面:据报道,在 Agent Arena 上,Kimi K3 Max 在开放权重模型中排名第一,净提升 +9.75%,在多个信号(包括确认成功和可操控性)上领先(@arena)。
在后续帖子中,它还在 Frontend Code Arena 的所有模型中排名第一(@arena)。
Cognition 表示,K3 是他们在 FrontierCode 1.1 上测试的第一个“接近前沿水平性能”的开源模型,得分 58.2%,通过率 63.6%(@cognition)。
Claude Opus 5 也发布了强劲的排行榜数据,但从业者反馈褒贬不一:Arena 报告 Opus 5 Max 在 Frontend Code Arena 和 Text Arena 中排名第一,事实性方面(@arena),
而 @htihle 的 WeirdML 数据显示 Opus 5 high/max 为 91.6%/91.8%,与 Fable 5 max 大致持平。
但多位开发者报告了令人沮丧的真实世界行为——过度复杂、故障、停止行为不佳——来自 @abacaj、@davis7、@Teknium 和 @theo。
与往常一样,公开评估收益与特定工具链的生产效用正在分化。
新的评估工作聚焦于顺序退化与隐藏回归:@_philschmid 强调了 EvoCode,这是一个围绕持久容器中 26 个任务 / 227 个顺序轮次构建的评估,衡量智能体能否在不破坏早期行为的情况下遵循不断变化的需求。
与此同时,@omarsar0 总结了一篇论文,展示了智能体技能的“回归税”:在近 6000 次配对运行中,技能带来了收益,但也破坏了许多之前无需它们就能解决的任务。这是一个实用的警告,反对天真地将更多程序性技能塞入上下文。
多模块 RL 系统正在表现出“角色漂移”:@omarsar0 的另一篇有用论文摘要描述了端到端 RL 如何提高流水线准确性,同时导致模块悄悄放弃内部