阿里智谱同天甩出Flash模型:125B对320B,谁更省钱

代码杰哥AI学习 2026-08-27 22:56:29 6阅读 举报

8月26日晚上,国内大模型圈罕见地出现了"同天双发"的场面。

阿里通义千问发布Qwen3.8-Flash,智谱上线GLM-5.3-Flash。两家几乎同一时间公布、同一时间开源,而且都选了一个关键词:Flash。

什么意思?说白了就是——"我的模型很强,但更便宜"。

先看参数和架构

Qwen3.8-Flash是MoE架构,总参数125B,但每次推理只激活6B参数。你没看错,6B。再加上一个51B的N-gram Embedding记忆库,整体推理成本低到离谱。

阿里这次还引入了GDN和QSA混合注意力机制,在百万Token长上下文场景下能提速8倍以上。更狠的是训练成本较前代Qwen3.7-Plus降了近90%。

智谱这边,GLM-5.3-Flash总参数320B,单Token激活18B,也是MoE。和Qwen不同的是,GLM-5.3-Flash是原生多模态模型,文本、图像、视频都能处理。采用稀疏注意力加线性注意力混合架构,走的是"参数更大但效率也高"的路线。

价格才是重点

Qwen3.8-Flash的API定价:输入每百万Token 0.8元,输出2.7元。发布后不到24小时又降了一刀。

这个价格是什么概念?大概只有DeepSeek-V4-Flash的三分之一。对开发者来说,这意味着同样的预算可以跑三倍的调用量。

智谱GLM-5.3-Flash的定价目前还没公布具体数字,但官方口径是"相比前代大幅降低",而且开源权重,你可以自己部署。

两家同一天打价格战,受益的是所有做AI应用的人。

为什么Flash成了新方向

2025年的时候,大模型竞争的主旋律是"谁更大"。参数从70B卷到400B再到万亿,各家都在benchmark上较劲。

到了2026年,风向变了。企业用AI最大的瓶颈已经不是"模型不够聪明",而是"推理太贵"。当你每天要处理几百万次API调用时,每Token贵一毛钱,一个月下来就是几十万的差距。

Flash模型的逻辑很简单:用MoE架构把激活参数压到最低,在"够用"的智能水平下把成本打到地板。不是追求最聪明的模型,而是追求最划算的模型。

对开发者意味着什么

说句实在话,大部分AI应用根本不需要GPT-5.6 Sol那个级别的智能。你做客服机器人、做文档摘要、做代码补全,用Flash级别的模型完全够了,但成本能降一个数量级。

更便宜意味着更多场景变得可行。之前因为成本犹豫的中小企业,现在可以放手试了。之前只在核心业务用AI的公司,现在可以把AI扩展到边缘场景。

这就是Flash模型最大的价值——不是让最强的模型更强,而是让更多事情变得"用得起"。

开源是另一个关键信号

两家都选择了开源。Qwen3.8-Flash权重放到了HuggingFace和ModelScope,智谱GLM-5.3-Flash也是完全开源。

开源意味着你可以自己部署,不用被API价格绑架。对大公司来说,自建推理集群可能比调API还便宜。对研究人员来说,开源权重意味着可以在上面做微调和二次开发。

2026年的大模型竞争,已经从"比谁更聪明"变成了"比谁更便宜"。Flash模型不是终点,但它标志着推理成本正在成为新的竞争维度。对开发者来说,这是好事。

版权声明:
作者:代码杰哥
链接:https://www.aiddithome.com/p/4e7972c0b1953.html
来源:AI学习
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
5条评论
Buffett
1楼 · 12小时前

智谱GLM-5.3-Flash的原生多模态是亮点,320B总参数里图文视频都能处理,这个覆盖面比纯文本的Flash模型广多了 ?

AI摸鱼大王
2楼 · 12小时前

便宜就是正义,我选择把省下来的API费用拿去摸鱼 ☕

码斯克
3楼 · 12小时前

开源权重才是真正的杀招。自己部署的话推理成本可以进一步压缩。我现在跑Qwen3.8-Flash,用一张4090就能撑住日均百万级调用。之前想都不敢想。

算法老K
4楼 · 12小时前

6B激活参数跑出125B的效果,这个性价比确实离谱。我跑了下benchmark,在代码生成任务上和某些闭源模型差距不到5%,但价格只有十分之一。对中小团队来说这就是最实际的选择。

AI搞钱研究所
5楼 · 12小时前

从商业角度看,Flash模型打的是'用量战'而非'质量战'。单价低了,但调用量会上去。阿里的策略很清晰——用低价模型圈住开发者生态,等Qwen4正式发布再收割高端市场。