GLM 5.2 与即将到来的人工智能利润率暴跌
本文探讨开放权重模型 GLM 5.2 如何以极低成本接近前沿模型性能,并分析推理利润率即将崩溃对 AI 行业格局的深远影响。
GLM 5.2 与即将到来的人工智能利润率暴跌(第一部分)这是一个由两部分组成的系列,重点关注我认为可能是人工智能经济学中最不被理解的一个即将到来的转变。如果你喜欢这篇文章并希望收到第二篇的通知,请随时订阅我的通讯。
真正的 DeepSeek 时刻即将来临。感觉像是几十年前的事,市场对 DeepSeek 的 R1 模型感到恐慌。理由是,鉴于其基础 V3 模型据报道训练成本不到 600 万美元,市场因此认为用于模型训练的巨大资本支出已经结束,导致英伟达等公司的股价一夜之间暴跌。
当然,这是对 AI 实际成本所在的一个极其糟糕的解读。训练——虽然无疑是资本密集型——是一项固定的前期成本。你花费数亿美元训练一个模型,然后你就“完成了”。[1]另一方面,推理成本随需求扩展。
它具有真正的边际成本。在过去一年左右的时间里,我已经详细写过这一点。同样,主流对此的理解——即提供商收取的 API 成本就是他们的实际成本——是错误的。
事实上,当 Anthropic/OpenAI 收取 25 美元/百万 token 的推理费用时,我的粗略计算表明,这大概是计算成本相对于标价的 90% 毛利率。
这个数字可能略高或略低(OpenAI 泄露的财务数据显示收入毛利率约为 60%,但这无疑包括大量其他成本,如支持、支付处理和他们提供的其他服务),但前沿 AI 实验室的整个商业模式简而言之就是:花费大量资金在算力和人员工资上训练模型,
然后将这些成本摊销到大量高利润的推理中。如果你能将成本摊销到足够多的推理上,你就能从基于销货成本的盈利转变为……真正的盈利。GLM 5.2过去几周我一直在使用智谱 AI 的 GLM 5.2。
我相信 GLM 5.2 是第一个达到 Opus 和 GPT 真正开放权重竞争对手“门槛”的模型(在撰写本文时,GPT 的最新版本是 5.5——未来的模型无疑会超越它)。它确实非常好,我很难区分它和我日常使用的 Opus 之间的差异。
我发现它速度较慢,因为它倾向于进行大量思考。对于非交互式的智能体任务(比如在后台审查 PR),这些任务对时间不敏感,这不是问题;但对于交互式使用,它确实有点太慢,无法保持我的注意力。这也在一定程度上降低了它的成本效益(更多的思考意味着更多的 token,从而增加成本)。
它也不支持视觉功能。
有趣的是,我从几乎从不想使用视觉功能(因为它非常不准确,当我发现它使用视觉时,我经常暂停会话),变成了一直使用它——自从 Opus 4.7 引入了更高分辨率的视觉能力。无法读取基于图像的 PDF、截图和设计文件确实令人沮丧。
我相信他们正在开发一个更多模态的模型,但这是相对于前沿实验室的一个显著弱点。其次,我确实没想到会成为障碍的是缺乏或较差的网络搜索能力。事实证明,几乎每个智能体会话都会进行大量网络搜索来查找项目。
智谱 AI 提供了一个替代的 MCP 用于网络搜索,但它非常糟糕且缓慢。Fireworks 没有提供任何搜索功能,尽管他们给了我一个非常模糊的答复,说他们一直在寻求改进产品。我个人认为这意味着没有计划,但让我们拭目以待。
我通过告诉智能体使用基于 CLI 的网络搜索(如 ddgr)来部分解决这个问题,但这是目前的一个真正弱点。我非常看好第三方网络搜索 API 的潜力。这实际上是开放权重模型提供商所能提供的一个巨大差距,而事实证明,强大的网络搜索能力对于许多智能体任务至关重要。
无论如何,这无疑会随着时间得到解决——有很多人在构建网络搜索索引,只需要正确的合作伙伴关系和基础设施到位。
即插即用对前沿实验室来说真正可怕的是迁移到开放权重模型是多么容易。智谱 AI 和 Fireworks 都提供兼容 OpenAI 和 Anthropic 的端点。这使得它们与 Claude Code 和 Codex 一起使用变得极其简单。
你只需将基础 URL 指向你的推理提供商,提供 API 密钥,然后告诉它使用 GLM 5.2。鉴于 Anthropic 最近宣布(然后又撤回)对 Claude 的非交互式智能体使用收取 API 费率,你会发现对于许多/大多数此类用例,你可以直接替换为 GLM。
而对于交互式使用,除了缺乏视觉功能和速度较慢[2]之外,我几乎无法意识到我在 Claude Code 中使用的不是 Opus。这不是微软或 Salesforce 那样的锁定,你需要花费数年时间规划迁移。
转换成本极低,而且我认为实际上远低于试图跟上前沿实验室模型经常变动的所有政策和条款变化。Claude Code 可能会让使用第三方提供商变得更加困难,但有许多优秀的开源选项(如 Codex 本身和 OpenCode 等数十个)。
我确实从企业那里听到的一个担忧是数据隐私和安全。毫无疑问,使用智谱 AI 的官方 API 和订阅几乎是不可能的,因为他们的条款充其量也很薄弱,而且与中国大陆有深厚联系。
但当然,由于开放权重是开放的,市场上还有许多其他提供商,其中许多有适当的合同条款。而且,如果这还不够,你当然可以自己在本地托管,这实际上可以将更敏感的数据——那些不能发送给任何第三方的数据——开放给 Opus 质量的智能体工作流程。
成本节省GLM 5.2 的当前费率似乎在每百万 token 4.40 美元左右。这不到 Opus 零售价的 20%,大约是 GPT 5.5 成本的 15%。现在,鉴于它确实为给定任务使用更多 token,这不是一个完全对等的比较。
但如果对于几乎所有工作流程,它都比前沿模型便宜 50% 以上,同时质量水平非常相似,我会感到非常惊讶。在订阅方面,智谱 AI 提供了一种“编程计划”订阅,与 Anthropic 和 OpenAI 的计划类似,但声称的使用限制更高。
我预计对于大多数专业用途来说,关于训练和数据保留的非常宽松的条款会使它难以销售,但如果前沿实验室试图大幅提高定价,我可以看到它对于预算敏感的人来说是一个可靠的选择。我预计 GLM 5.2 的这些成本在未来几个月还会大幅下降,因为对服务栈进行了更多优化。
Wafer 写了一篇有趣的文章,介绍了他们在 AMD 硬件上运行它的努力。他们指出,在 AMD 上运行推理每 token 成本比英伟达 Blackwell 便宜 2.75 倍。
第二部分才是真正有趣的地方——推理利润率的崩溃实际上对行业意味着什么,以及谁可能赢、谁可能输。我会记住贝佐斯那句著名的“你的利润就是我的机会”。如果你希望文章发布后立即收到通知,请订阅我的通讯——或者如果你更喜欢,可以获取 RSS 订阅。
披露:Fireworks 慷慨地给了我一些免费额度来尝试 GLM,以帮助撰写本文。[1] 这是一个简化——前沿实验室实际上在不断训练新模型以保持竞争力,所以这实际上是一个滚动成本,而不是真正的一次性成本。
但关键区别仍然成立:与推理不同,该成本不随客户实际使用产品的程度而扩展。[2] 公平地说,速度慢主要是模型思考过多,而不是服务本身——Fireworks 以每秒约 50 token 的速度推出了 GLM 5.2,这比 Opus 的典型速度慢,但并非不可用。