Kimi K3 发布:2.8万亿参数开放权重模型,以及我们仍能从鹈鹕基准测试中学到什么
中国AI实验室Moonshot AI发布Kimi K3,拥有2.8万亿参数,自称首个开放3T级模型,在多项基准上超越GPT-5.5和Claude Opus 4.8,但定价较高。作者通过经典的“鹈鹕骑自行车”测试,探讨了该模型的特点及该测试的当前价值。
Kimi K3,以及我们仍然可以从鹈鹕基准测试中学到什么2026年7月16日中国AI实验室Moonshot AI今早宣布推出Kimi K3,将其描述为“迄今为止最强大的模型,拥有2.8万亿参数”。
该模型目前可通过其网站和API使用,但承诺“在2026年7月27日之前”发布开放权重版本。Moonshot称其为第一个“开放3T级模型”(我猜他们将2.8万亿四舍五入为3万亿),从DeepSeek的1.6T v4 Pro手中夺走了桂冠。
他们自行报告的基准测试显示,K3大多击败了Claude Opus 4.8 max和GPT-5.5 high,但输给了Claude Fable 5和GPT-5.6 Sol。
来自Artificial Analysis对该模型报告的一些亮点:- “在我们的私人长期知识工作评估中,Kimi K3达到了1547的整体Elo,比Kimi K2.6高出732分,仅次于Claude Fable 5。
”- “每任务成本(0.94美元)与GPT-5.6 Sol(1.04美元)相似,约为Opus 4.8(1.80美元)价格的一半,高于开放权重同行。
”- “Kimi K3在Artificial Analysis Intelligence Index上的token使用量显著下降,输出token比K2.6减少了21%。
”该模型现在也是Arena.ai的Frontend Code竞技场上的领先模型,甚至超越了Claude Fable 5。
新模型的定价引人注目:每百万输入token 3美元,每百万输出token 15美元,与Anthropic的Claude Sonnet系列处于同一水平,成为迄今为止中国AI实验室发布的最昂贵的模型。
这相比他们早期的模型(如Kimi K2.6,价格为0.95美元/4.2美元)有显著提升。2.8万亿参数也是那个1T模型的两倍多。但它在鹈鹕测试中表现如何?
我使用OpenRouter(以避免注册Moonshot API密钥)和llm-openrouter插件生成了一个骑自行车的鹈鹕的SVG:llm -m openrouter/moonshotai/kimi-k3 '生成一个骑自行车的鹈鹕的SVG'这是记录。
它看起来像这样:那只鹈鹕消耗了95个输入token和16,658个输出token(其中13,241个是推理token),总成本为25美分!
由于K3接受图像输入,我让它对上面渲染的SVG(加上我的alt文本提示)进行处理,得到了(花费0.6美分):卡通插图:一只戴着红色围巾的白色鹈鹕,骑着红色自行车,沿着一条有白色虚线的灰色道路行驶;
鹈鹕有一个橙色的大喙和带蹼的橙色脚在踩踏板,身后有白色运动线;背景是浅蓝色天空,有白云、黄色太阳、两只飞行的小黑鸟,前景是绿色草地和白色小花。我们能从鹈鹕身上学到什么?我的“生成一个骑自行车的鹈鹕的SVG”测试已经21个月了。
它从来不是一个特别好的基准测试。它最初是一个笑话,关于比较这些模型有多么荒谬困难,但在第一年,它却与模型的实际表现有着惊人的相关性。现在这种联系基本已经断了。
GPT-5.6和Claude Fable 5的鹈鹕被GLM-5.2超越,尽管我很喜欢GLM,但我不认为那是Fable级别的模型。(我仍然不相信实验室在为这个基准测试进行训练——如果是的话,我期望得到更好的结果。
不过,Gemini有可能针对任何动物与交通工具的组合进行了优化!)鹈鹕测试最大的局限性是它完全没有触及当今模型最重要的方面:智能体工具调用,以及随着对话长度增长可靠操作工具的能力。所以不要用鹈鹕来比较模型!
尽管如此,我自己运行这个基准测试仍然获得了一些价值。首先,它是一个强制函数,促使我实际尝试模型。如果我展示一个鹈鹕,意味着我成功通过它运行了一个提示。如果模型有官方API,我会使用它;
如果是开放权重(并且小到可以装进128GB M5 MacBook Pro),我会尝试在自己的机器上运行,通常通过llama.cpp、LM Studio或Ollama。我经常使用OpenRouter,因为它通常提供官方API的代理,无需新的API密钥。
我的大多数鹈鹕都是使用我的LLM CLI工具生成的,这有助于确保该工具(通过其插件之一)支持最新模型。但更重要的是,即使是单个提示“生成一个骑自行车的鹈鹕的SVG”的行为,也能揭示有趣的模型特征。
考虑今天Kimi K3的结果。运行这些简单提示有助于强调该模型的几个要点。- 它目前只有一个推理努力级别“max”——这很明显。模型消耗了13,241个推理token来输出3,417个响应token。
这很昂贵——鹈鹕花了25美分!- 提示“生成一个骑自行车的鹈鹕的SVG”如何累计到95个输入token?OpenAI的分词器计数为10,Anthropic的Opus 4.6计数为10,Opus 4.7为30,Sonnet 5/Fable 5为25。
向Kimi K3提示“hi”计数为86个token,表明可能存在85个token的隐藏系统提示。不过它拒绝泄露。- 视觉能力很好:它生成的alt文本非常好。K3目前只有一个思考努力级别,但我最近从在不同努力级别上运行相同的鹈鹕提示中获得了不少价值,以快速了解它们的影响。
例如,这是我的GPT-5.6模型家族的矩阵。不过,我从鹈鹕测试中获得的主要收获是:- 它是提示模型的“hello world”练习- 对简单任务的粗略成本和推理估计- 确认模型可以输出有效的SVG,并具有基本的几何和空间意识。
对于在我的笔记本电脑上运行的较小模型来说,这更重要。- 比较同一模型家族不同版本之间的鹈鹕仍然很有趣。K3的鹈鹕相比Kimi 2.5有显著改进。
- 这是我可以分享的东西,证明我已经尝试过。此外,在Hacker News上,带鹈鹕的评论现在几乎成了一种传统,每当我迟到时,都会有人评论问鹈鹕在哪里!
更多近期文章- 新的GPT-5.6家族:Luna、Terra、Sol - 2026年7月9日- sqlite-utils 4.0,现在支持数据库模式迁移 - 2026年7月7日