AI 见闻
精选· 重要性 5/5

Kimi K3 2.8T-A50B:史上最大开放权重模型发布,Opus 4.8级性能仅需Sonnet 5价格

Latent Space (Swyx)··约 8 分钟阅读
中文导读

Moonshot AI 发布 Kimi K3,总参数达 2.8T,为迄今最大开放权重模型,性能接近顶级闭源模型,定价却与 Sonnet 5 看齐,标志着开放模型迈入新里程碑。

[AINews] Kimi K3 2.8T-A50B:史上最大开放模型发布;Opus 4.8 级性能,Sonnet 5 定价开放模型精彩的一周仍在继续。Z.ai GLM 最近获得了太多关注,现在是 Kimi K3 反击的时候了!

很难正确看待今天开放模型发布的规模,所以谢天谢地 Moonshot AI 为我们做到了:他们的氛围短片完全由 Kimi K3 编辑,值得一看:你可以阅读 SimonW 和 Arena 了解标准评测和排名,考虑到模型的大尺寸,这些都不会特别意外,

但这张图最好地总结了从 K2.5 到 K3 的飞跃:2026年7月15日至16日的AI新闻。我们检查了12个 subreddits、544条 Twitter,没有进一步的 Discord。AINews 网站允许你搜索所有过往期次。

提醒一下,AINews 现在是 Latent Space 的一部分。你可以选择加入/退出邮件频率!AI Twitter 回顾Moonshot AI 推出了 Kimi K3,作为一款前沿级的开放权重模型,官方声称其接近顶级闭源模型,并超越之前的开放竞争对手。

Moonshot 正式将 Kimi K3 定位为“开放前沿智能”,拥有 2.8T 总参数、100 万 token 上下文、原生多模态输入、Kimi Delta Attention (KDA) 和 Attention Residuals,并表示该模型已在 Kimi 上上线。

com、Kimi Work、Kimi Code 和 API,开放权重承诺于 2026 年 7 月 27 日前提供 @Kimi_MoonshotMoonshot 还强调了围绕长周期智能体编码和自我进化工作流的产品定位,以及“视觉在环”的编码/游戏构建工作流,

可在代码和截图之间迭代 @Kimi_Moonshot在正式公告之前,

多个账号流传了泄露或从应用获取的细节,称 K3 有 2.8T 参数,如果权重按承诺发布,将是史上最大的开放权重模型 @scaling01,@scaling01,@eliebakouchKimi 官方博客随后上线,并被广泛分享为主要技术来源 @Jianlin_S,

@scaling01,@Yulun_DuMoonshot 自己的措辞承认了一个局限性:尽管整体竞争力很强,但 K3 与 Claude Fable 5 和 GPT-5.6 Sol 相比,

“在用户体验方面仍然存在明显差距” @scaling01Arena 宣布 Kimi K3 进入 Agent Arena,

以及 Text、Vision、Document 和 Frontend Code Arena,社区评估将随后进行 @arenaArena 随后报告了一个重要的早期结果:Kimi K3 以 1679 分成为 Frontend Code Arena 第一名,

超越 Claude Fable 5,

从第 18 名(K2.6)跃升至第 1 名,在 7 个前端领域中的 6 个排名第一,在游戏领域排名第二 @arenaArena 后来补充说,K3 在 Frontend Code Arena 中的成对胜率为 76%,而 Fable 5 为 63%,

GPT-5.6 Sol 为 58%。

6 Sol @arena在 Text Arena 中,K3 以 1486 分排名第 9,从第 38 名跃升,在创意写作、编码和指令遵循方面进入前十,并在多个职业细分领域排名第一 @arenaArtificial Analysis 发布了一项独立评估,

将 K3 在 AA 智能指数中评为 57 分,称其与 Opus 4.8 和 GPT-5.5 相当,但整体仍落后于 Fable 5 和 GPT-5.6 Sol @ArtificialAnlysAA 还报告了 K3 在 GDPval v2 上的 Elo 为 1668,

在 AutomationBench-AA 上为 53% / 排名第一,

在 AA-Briefcase 上 Elo 为 1547,每任务成本为 0.94 美元,在整个智能指数运行中输出 token 比 K2.6 减少约 21% @ArtificialAnlys此次发布立即引发了工程师和模型观察者的强烈反应,他们将 K3 视为开放模型的里程碑,

可与早期的 DeepSeek 时刻相媲美 @kimmonismus,

@nrehiew_,@eliebakouch技术细节架构和系统细节官方规格:2.8T 总参数、100 万上下文、原生多模态输入(文本+图像)、文本输出、7 月 27 日前开放权重 @Kimi_Moonshot,

@ArtificialAnlysK3 使用 Kimi Delta Attention (KDA),Moonshot 表示这可以在百万 token 上下文中实现高达 6.3 倍的解码加速 @Kimi_Moonshot

它还使用 Attention Residuals (AttnRes),声称以低于 2% 的额外成本实现约 25% 的训练效率提升 @Kimi_Moonshot博客的社区读者强调了额外的架构细节:LatentMoE / Stable LatentMoE,

896 个专家中激活 16 个,意味着激活率低于 2% @nrehiew_,@eliebakouch更多社区从博客/报告讨论中提取的细节:per-head Muon、QB 负载均衡 / 分位数负载均衡,

以及一种名为 SiTU (Sigmoid Tanh Unit) 的新激活函数 @eliebakouch一位工程师指出,

该架构因结合了 KDA + LatentMoE + AttnRes,同时规模比之前的 Kimi 模型扩大了两倍以上而引人注目 @teortaxesTexKDA 的孵化周期很长:据报道设计始于 2025 年 1 月,

耗时约 1.5 年才达到前沿规模 @zxytim推理与服务K3 定价报告为每百万输入 token 3 美元,

每百万输出 token 15 美元,缓存输入折扣 90% 至每百万 0.30 美元 @scaling01,@ArtificialAnlys几位发帖者将该定价与 Sonnet 5 进行比较,一些人指出 Sonnet 在 8 月底之前暂时更便宜,

之后价格会更接近 @kimmonismus80% 输入 / 20% 输出的混合估算为每百万 token 5.40 美元,

而 Opus 4.8 为 9 美元,GPT-5.5 为 10 美元 @jaminballArtificial Analysis 估算每个智能指数任务的平均成本为 0.94 美元,而 GPT-5.6 Sol 为 1.04 美元,Opus 4.8 为 1.80 美元。

8 @ArtificialAnlys早期实时服务观察:通过 OpenRouter 上的 Moonshot API 约为 28 tok/s @scaling01,另一位观察者看到 26 tok/s,称其比 Opus 慢,并推测推测性解码尚未启用 @nrehiew_,

@nrehiew_据报道,Moonshot 的博客建议部署在具有 64 个以上加速器的超节点配置上,以获得最佳推理效率 @teortaxesTexvLLM 表示 Moonshot 直接向 vLLM 贡献了 KDA 前缀缓存实现,

官方发布当天即可提供支持 @vllm_projectMoonshot 的 KDA 贡献被认为很重要,

因为 KDA 打破了传统前缀缓存背后的假设,因此需要对上游运行时进行更改 @vllm_project基准测试与评估Moonshot 的官方基准测试信息,正如其他人总结的那样,将 K3 定位为仅落后于 Claude Fable 5 和 GPT-5.6 Sol,

领先于 Claude Opus 4.8 @scaling01,

@Yuchenj_UW一个引用的数字:GDPval-AA v2 上 1687 分,高于 Opus 4.8,落后于 GPT-5.6 Sol 的 1747.8 分 @scaling01Artificial Analysis 的独立数据:AA 智能指数:

57GDPval v2 Elo:

1668AutomationBench-AA:53%,排名第一AA-Briefcase Elo:1547AA-Omniscience:+18,准确率 46%,而 K2.6 为 33%,但幻觉率从 39% 恶化至 51% @ArtificialAnlys,

@ArtificialAnlysAA 还报告称,K3 在整个智能指数中消耗了 1.32 亿输出 token,而 K2.6 为 1.66 亿,即

减少了 21%,同时获得了 13 个指数点 @ArtificialAnlysArena 的前端结果尤其突出,因为这是一个成对的人类偏好竞技场,而不仅仅是静态基准测试,K3 的前端排名第一成为发布的主要头条之一 @arena社区帖子还强调了在内核优化任务上的强劲表现,

一些人表示 K3 在某些内核/代码生成设置中与 Fable 相当或超越 @nrehiew_,

@scaling01ProgramBench 作者 Ofir Press 提出了一个基准测试注意事项,他说 Kimi 使用了一个他们不推荐的指标:平均实现百分比,而不是计算完全工作的程序,这可能会夸大实用性 @OfirPress,

@OfirPress事实与观点事实 / 直接来源的主张Kimi K3 由 Moonshot 正式宣布 @Kimi_Moonshot官方披露的规格包括 2.8T 参数、

100 万上下文、原生多模态输入、KDA、AttnRes、7 月 27 日前开放权重 @Kimi_MoonshotArtificial Analysis 独立评分 K3 为 57 智能指数,并提供了详细的任务、成本、

token 和基准测试数据 @ArtificialAnlysArena 独立将 K3 排名为 Frontend Code Arena 第一,

随后报告其 76% 的成对胜率 @arena,@arenavLLM 确认 Moonshot 贡献了 KDA 前缀缓存的运行时支持 @vllm_project观点 / 解释“DeepSeek 时刻”、“开始

原文出处
[AINews] Kimi K3 2.8T-A50B: the largest open model ever released; Opus 4.8-class at Sonnet 5 pricing

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读