智谱开源GLM-5.3-Flash:320B只激活18B,还跑在10万张国产卡上

代码杰哥AI学习 2026-09-04 12:46:43 6阅读 举报

上周那个在海外开发者圈刷屏的匿名模型Ox-Alpha,谜底揭晓了:它是智谱的GLM-5.3-Flash。中文社区给它起了个外号,叫"牛来"。

我先说结论:这不是一个冲着"最强"去的模型,而是一个冲着"又便宜、又快、还能看图"去的模型。这三个词,恰好戳中了现在开发者最疼的地方。

320B的模型,只激活18B

参数先摆出来:总参数3200亿,每次推理只激活180亿。这就是MoE架构的玩法,看着是个大块头,干活的只有一小撮。

跟上一代GLM-4.5比更直观:总参数355B降到320B,激活参数从32B砍到18B,层数从92砍到45,几乎对半。用更少的计算资源,跑出了更强的性能。

在Artificial Analysis的综合智能指数上,它拿了57分,跟Anthropic的Claude Opus 4.8持平,高于自家GLM-5.2的53分,也压过了DeepSeek V4 Pro的53分。

会看图写代码,才是真本事

GLM-5.3-Flash是GLM-5系列里第一个原生多模态模型。这个"原生"不是外挂个视觉编码器,而是把视觉揉进了编码循环里:模型写完前端,会自己截图看渲染效果,发现按钮歪了就改,改完再看。

这解决了Coding Agent一直缺的那块拼图,视觉反馈。以前AI写前端是盲写,现在它能看见自己写成了什么样。

官方演示里,它不做人工干预,在Blender里自主跑了16个小时,搭出一套400平米的房子。这种自主长跑演示看个热闹就行,但"看-做-改"这个闭环方向,是对的。

价格才是杀手锏

能力对标Opus 4.8,价格呢?每百万token输入0.8元、输出2.8元,是GLM-5.3的十分之一,限时折扣期低到二十分之一,算下来只有Opus 4.8的四十分之一。

这个价格放在Agent场景里意义很大。一个Agent完成复杂任务要调几十上百次API,token消耗指数级涨。价格不下来,再强的模型企业也用不起。

而且它用的是MIT协议,权重直接开放,商用没限制。想自己部署也行,但320B总参数对显存要求不低,生产环境还是走API更省心。

10万张国产卡,这件事比模型还大

真正让我意外的,是它的算力底座。智谱披露,Ox-Alpha测试期的全部流量,加上发布后的线上服务,都由10万张国产芯片承载,每天服务量到100万亿token级别。

这不是"国产卡能跑通一个模型"的实验室证明,而是"国产卡在撑起一个生产级大模型"的规模事实。性能上,端到端服务效率比初始基线提升了3倍,单token成本已经跟主流英伟达GPU相当。

过去行业默认的剧本是"大模型等于英伟达显卡堆出来的"。GLM-5.3-Flash这一下,等于把这个等式打了个问号。

这个坑我踩过了,你们直接抄作业:大模型的价格战,从"谁更强"打到了"谁更便宜还能跑得动"。对开发者来说,这是好事。

版权声明:
作者:代码杰哥
链接:https://www.aiddithome.com/p/11698083e3d2.html
来源:AI学习
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
5条评论
熵熵
1楼 · 22小时前

牛来模型,跑在十万张国产卡上,这画面想想还挺带感的?

码斯克
2楼 · 22小时前

注意力计算量降3倍、KV缓存缩4.4倍,这些才是硬功夫。参数堆再多,推理成本下不来都是耍流氓。

算法老K
3楼 · 22小时前

MoE这套确实省。激活18B跑出Opus 4.8的水平,关键是视觉编码循环这个设计,AI终于能看见自己写的界面了。Coding Agent的最后一公里。

工具猎人
4楼 · 22小时前

价格1/40这个数字要结合场景看。Agent场景token消耗是指数级的,价格打下来,很多以前不敢上的批量调用才敢上了。我已经在本地跑了几天,回头出个实测。

AI搞钱研究所
5楼 · 22小时前

MIT协议开放权重加国产卡,这才是关键。之前开源模型要么能力差一档,要么跑不动。现在价格和算力都突破了,做AI应用的账能算平了。