8月14日,智谱悄悄发了GLM-5.3。没开新闻发布会,没有铺天盖地的预热,就发了个模型权重和API。
但看完数据之后我觉得,这可能是近期国产开源模型里最值得关注的一次更新。
编程能力直逼Claude Fable 5
先看硬数据。
Terminal-Bench 3.0得分从4.6飙到28.3。DeepSWE v1.1从46.2升到66.9。Agents' Last Exam从23.8涨到28.5。
这些数字意味着什么?智谱官方说法是,GLM-5.3在多项主流基准测试中是当前排名最高的开源模型,编程与智能体能力接近Claude Fable 5。在网络安全领域的白盒代码审查与漏洞发现任务中,表现也持平Mythos 5。
有意思的是,GLM-5.3的基座模型和GLM-5.2保持一致。能力提升主要来自后训练阶段的Scaling,包括数十倍长程任务环境、更丰富的环境类型和更长的训练时间。换句话说,不是换了一个更强的底座,而是在同样的底座上通过更大的后训练投入,把能力压榨出来了。
定价策略也很有意思
GLM-5.3 API上线后采用了峰谷分时定价。空闲时段每百万Tokens输出价格较低,高峰时段则翻倍。V4-Pro同步结束测试转为正式商用,输出价格最高到27元每百万Tokens。
这说明什么?国产模型的价格战可能要告一段落了。此前DeepSeek V4系列已经把价格打到极低,现在GLM-5.3反而涨了。模型厂商开始意识到,单纯靠低价换市场不是长久之计,能力和定价要匹配。
对比一下,DeepSeek V4 Pro空闲时段输出13.5元每百万Tokens,GLM-5.3稍微便宜一些。两家在定价上保持了微妙的平衡。
开源模型的实用性正在质变
从实用角度看,GLM-5.3最值得关注的不是"又刷新了排行榜",而是它让开源模型在编程和Agent场景下真正可用了。
以前开源模型做编程任务,效果差距闭源模型一大截。现在这个差距正在快速缩小。对于中小企业来说,能本地部署的开源模型意味着更低的推理成本和更高的数据安全性,在很多场景下比用闭源API更划算。
另外值得注意的是,腾讯Q2财报显示资本支出528亿元,同比增337亿元。国产大模型赛道正在进入新一轮"军备竞赛"。GLM-5.3在这个时间点发布,某种程度上也是智谱在向市场证明:开源路线也能跑出前沿水平。
模型能力的"全面化"趋势
GLM-5.3同时在编程、Agent和网络安全三个方向发力,这种"全面化"趋势值得关注。
此前模型厂商更多是在某一个方向做突破,比如有的专攻代码、有的专攻对话、有的专攻多模态。但GLM-5.3的策略是在一个模型上同时拉高多个维度。这和实际应用场景的需求是匹配的,真实业务场景往往需要模型同时具备多种能力。
接下来就看真实业务场景中的落地表现了。数据跑分是一回事,实际用起来是另一回事。

峰谷定价这个设计挺有意思,错峰使用更便宜,鼓励开发者在凌晨跑批处理任务。对算力利用率和用户成本都有好处。
GLM-5.3和DeepSeek V4 Pro的定价差那么一点,看来国产模型在价格上确实形成了默契?
开源模型编程能力接近Claude了?那我得试试本地部署。数据安全这块确实比用API放心多了。
智谱这次没有大张旗鼓做宣传,直接发权重和API,这种风格挺好的。让数据和实际体验说话,比开发布会吹半天强。
价格战告一段落这个判断我同意。之前模型厂商疯狂降价,但长期来看不可持续。能力和定价匹配才是正道。