Reed's News
← 返回精选

GLM 5.2 与即将到来的 AI 推理利润率崩溃

AI 56 martinald 2026/7/6 1359 字 原文 ↗

本文是系列文章的第一篇,聚焦我认为目前最被忽视的AI经济转型趋势。若你喜欢本文,希望收到第二篇推送,欢迎订阅我的通讯。

真正的DeepSeek时刻已到来

仿佛已是很久以前的事了:DeepSeek推出R1模型时,市场一片恐慌。当时的逻辑是,传闻其底层V3模型训练成本不足600万美元,因此市场认为,大模型训练的巨额资本投入时代已结束,Nvidia等企业股价一夜暴跌

当然,这是对AI真实成本结构的严重误判。训练固然是资本密集型投入,但属于固定前置成本——投入数亿美元完成模型训练后,这部分开支就告一段落。[1]

而推理成本则完全不同:它随需求规模同步增长,是真正的边际成本。过去一年多我曾多次撰文探讨这一点。主流认知仍存在误区:认为AI服务商收取的API费用,就是他们的实际成本。

事实远非如此。Anthropic和OpenAI的推理定价为每百万令牌25美元,按我粗略估算,这相对于算力机架成本的毛利率约为90%。实际比例可能略有浮动(OpenAI泄露的财务数据显示整体营收毛利率约60%,但这其中包含客服、支付处理等其他服务成本),但前沿AI实验室的商业模式本质是:投入高薪和算力成本训练模型,再通过高利润的大规模推理业务摊销前期投入。只要推理量足够大,就能从覆盖可变成本走向真正盈利。

GLM 5.2

过去两周我一直在测试Z.ai推出的GLM 5.2。我认为,它是首个达到“真正能与Opus、GPT抗衡”水准的开源权重模型(撰写本文时,GPT最新版本为5.5,未来模型无疑会更胜一筹)。

它的性能确实出色,我几乎无法将其与日常使用的Opus区分开来。

不过我发现,由于模型“思考”过程较长,GLM 5.2的响应速度偏慢。对于非交互式智能体任务(比如后台审核PR),这种延迟无关紧要,但用于交互式场景时,速度确实有点跟不上注意力节奏。这也在一定程度上削弱了它的成本效益——思考过程越长,生成的令牌越多,成本也就越高。

此外,它暂不支持视觉功能。有趣的是,我已经从“基本不用视觉功能(因精度太差,看到模型调用视觉时经常暂停会话)”,转变为“离不开视觉功能”——自从Opus 4.7推出高分辨率视觉能力后,这项功能已成为刚需。GLM 5.2无法读取图片格式的PDF、截图和设计文件,这确实令人失望。我相信Z.ai正在开发多模态版本,但当前这一点是它相比前沿实验室模型的明显短板。

第二个没想到会成为障碍的问题是网页搜索能力薄弱。实际使用中几乎所有智能体会话都需要频繁搜索信息。Z.ai提供了替代的MCP网页搜索工具,但体验很差且速度慢;Fireworks则完全没有相关功能,只是含糊地表示“一直在寻求产品改进”。在我看来这相当于没有计划,但未来也可能有变化。

我目前通过让智能体使用基于命令行的网页搜索工具(比如ddgr)来部分解决这个问题,但这仍是当前的一大缺陷。我非常看好第三方网页搜索API的潜力——这正是开源权重模型服务商的一大缺口,而优秀的网页搜索能力对许多智能体任务来说至关重要。不过假以时日这个问题肯定能解决:已有不少团队在搭建网页搜索索引,只需建立合适的合作并完成技术整合即可。

无缝替代方案

对前沿AI实验室而言,真正可怕的是切换到开源权重模型的门槛极低。Z.ai和Fireworks都提供兼容OpenAI与Anthropic的接口,这使得将它们接入Claude Code和Codex变得异常简单:只需将基础URL指向推理服务商,填入API密钥,指定使用GLM 5.2即可。

Anthropic近期曾宣布(随后又撤回)对claude-p非交互式智能体使用收取API费用,而对于这类场景,大多数情况下都可以直接用GLM替代。至于交互式场景,除了缺少视觉功能和速度稍慢[2]外,我几乎无法察觉自己在Claude Code中使用的不是Opus。

这完全不同于微软或Salesforce那种“锁定式”生态——后者的迁移可能需要数年规划。而GLM的切换成本极低,甚至比跟上前沿实验室频繁变动的政策和条款还要轻松。或许Claude Code未来会限制第三方服务商的接入,但市场上有不少优秀的开源替代方案(比如Codex本身、OpenCode等数十种工具)。

企业客户常提到的顾虑是数据隐私与安全。毫无疑问,Z.ai官方API和订阅服务的条款不够完善,且与中国大陆关联紧密,对很多企业来说几乎无法接受。但开源权重的核心优势正在于此:市场上有众多其他服务商,其中不少能提供规范的合同条款。如果这还不够,企业完全可以本地部署,从而将原本无法交给任何第三方的敏感数据,纳入与Opus同水准的智能体工作流中。

成本优势

GLM 5.2的当前定价约为每百万令牌4.4美元,仅为Opus零售价的不到20%,约为GPT 5.5的15%。当然,由于完成相同任务它生成的令牌更多,这并非完全对等的比较,但可以肯定的是,在质量相近的前提下,它几乎能为所有工作流节省超过50%的成本。

订阅模式方面,Z.ai推出了“编码计划”,与Anthropic、OpenAI的套餐类似,但宣称的使用额度更高。不过其关于训练和数据留存的条款过于宽松,可能难以吸引专业用户;但如果前沿实验室大幅涨价,对预算敏感的用户来说,它会是极具竞争力的选择。

我预计未来几个月,随着推理服务架构不断优化,GLM 5.2的成本还会大幅下降。Wafer曾撰文介绍他们在AMD硬件上运行该模型的尝试,结果显示,在AMD上运行推理的每令牌成本比Nvidia Blackwell低2.75倍。

系列文章的第二篇将探讨更核心的问题:推理利润率暴跌会给行业带来什么影响,谁将成为赢家,谁又会被淘汰。不妨记住贝索斯的名言:“你的利润,就是我的机会”。若想第一时间收到推送,欢迎订阅通讯,或选择RSS订阅

披露:Fireworks为本文测试提供了免费额度支持。

  • 注:前文描述略有简化——前沿实验室为保持竞争力,实际上在持续训练新模型,因此训练成本是滚动投入而非一次性支出。但核心区别依然成立:与推理不同,训练成本不会随用户使用量的增长而增加。 - ↩︎
  • 公平地说,速度慢主要是因为模型“思考”过程长,而非推理服务本身——Fireworks推出的GLM 5.2令牌生成速度相当快,这是一大进步,值得关注,但实际使用中我发现其速度不太稳定。 - ↩︎