开源Flash模型同日发布:智谱和阿里打起了价格战,开发者终于不焦虑了

算法老KAI学习 2026-08-29 12:41:54 8阅读 举报

8月28日这天挺热闹的。智谱开源了GLM-5.3-Flash,阿里同一天发了Qwen3.8-Flash-Next。两家像是约好了一样,在同一天扔出了两颗炸弹。

但真正让人注目的不是同一天发这个巧合,而是它们的价格。

先看数字:卷到什么程度了

智谱GLM-5.3-Flash:总参数320B,激活参数18B。官方说法是价格只有Opus 4.8的四十分之一。四十分之一,你没看错。也就是说,原来用Opus跑一个任务花1块钱的事,现在用GLM-5.3-Flash只要2分5。

阿里Qwen3.8-Flash-Next:总参数125B,激活参数6B。更狠的是训练成本,官方说比上代降了近90%。6B激活参数就能干活,这个数字放在两年前是不可想象的。

两家都在做同一件事:用更小的激活参数,做到接近大模型的效果,同时把成本打到地板。这不是技术竞赛,这是成本竞赛。

Flash模型到底在解决什么问题

很多人看到"Flash"可能第一反应是"快"。没错,Flash模型推理速度确实快,但这不是核心。核心是便宜。

你想,一个AI应用如果要大规模跑,最大的成本在哪?不是开发,不是运维,是推理。每一个用户提问、每一次API调用,背后都是真金白银的算力消耗。模型越大,成本越高。很多AI产品不是做不出来,是算不过来账。

Flash模型的出现,就是专门解决这个"算账"问题。用混合专家架构(MoE),总参数很大但每次只激活一小部分,在保持效果的同时大幅压缩推理成本。对开发者来说,这意味着一个AI产品的运营成本可以从月均几万块降到几百块。

为什么是"同一天"

智谱和阿里同一天发Flash,我觉得不是巧合。开源模型赛道现在进入了一个关键阶段:模型能力差距在缩小,竞争维度从"谁更强"转向"谁更便宜"。

这个转变的底层逻辑是这样的:当所有主流模型都能做到"足够好"的时候,用户选谁就不取决于"谁更聪明",而取决于"谁更省钱""谁更快""谁的API更稳定"。这跟当年云计算打价格战是一个道理。

智谱之前匿名提交的"Ox Alpha"被证实是自家模型后引发了一波关注,这次直接开源GLM-5.3-Flash,明显是想在开源社区抢身位。阿里这边则是通义千问系列一直保持高频迭代,Flash-Next是延续"小参数大能力"的路线。

开发者真正的利好

说实话,大厂打价格战,最高兴的就是开发者。

一年前很多人还在纠结:用GPT吧太贵,用开源吧效果差。现在这个纠结基本不存在了。开源Flash模型的效果已经逼近闭源模型,而成本只有几十分之一。对99%的应用场景来说,Flash模型完全够用了。

而且还有一个隐藏的好处:Flash模型因为参数小、推理快,延迟也低。用户体感上就是"回复更快",这对很多实时交互场景(比如客服、对话、语音助手)特别重要。

我身边已经有团队从闭源API切到了开源Flash。不是因为情怀,纯粹是算完账发现一年能省几十万。这种从"不得不选"到"主动选择"的转变,说明开源模型生态真的成熟了。

价格战的终局在哪

价格战不可能无限打下去。Flash模型把成本压到这么低之后,下一步竞争会转向哪里?

我觉得有三个方向。第一是场景适配。通用模型卷完了,接下来是针对特定场景(代码、法律、医疗、教育)的微调版本。谁的垂直场景做得好,谁就能拿到溢价。第二是推理效率。同样的模型,谁跑得快、延迟低、并发高,谁就有优势。第三是生态绑定。阿里的模型配合阿里的云服务,智谱的模型配合智谱的API平台,生态越完善,用户迁移成本越高。

对普通开发者来说,这些神仙打架的结果就是:你的工具箱越来越强,你的账单越来越短。挺好的。

版权声明:
作者:算法老K
链接:https://www.aiddithome.com/p/9893ba1ad216.html
来源:AI学习
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
6条评论
画画酱
1楼 · 22小时前

同一天发模型,这是约好了打群架吗? 开发者最开心:你们打你们的,我省我的

安利君
2楼 · 22小时前

四十分之一的价格,这不叫降价,这叫重新定义什么叫'贵'

AI搞钱研究所
3楼 · 22小时前

6B激活参数就能干活,两年前谁能想到这个数?现在125B参数的模型训练成本降90%,AI的摩尔定律比芯片的还猛

代码杰哥
4楼 · 22小时前

价格战打到这个程度,其实已经不是在卷模型了,是在卷基础设施。谁能把推理效率做到极致、把部署成本压到最低,谁就能在价格上保持优势。Flash模型的背后是芯片适配、算子优化、推理框架这一整套东西的较量。

码斯克
5楼 · 22小时前

MoE架构才是这波Flash模型潮的真正主角。320B总参只激活18B,这不是偷懒,是工程上的最优解。大模型的参数就是知识库,激活参数就是工作记忆,你不需要同时调动所有知识来回答每一个问题。这个思路对了,成本问题自然就解决了。