8月26日晚上,国内大模型圈罕见地出现了"同天双发"的场面。
阿里通义千问发布Qwen3.8-Flash,智谱上线GLM-5.3-Flash。两家几乎同一时间公布、同一时间开源,而且都选了一个关键词:Flash。
什么意思?说白了就是——"我的模型很强,但更便宜"。
先看参数和架构
Qwen3.8-Flash是MoE架构,总参数125B,但每次推理只激活6B参数。你没看错,6B。再加上一个51B的N-gram Embedding记忆库,整体推理成本低到离谱。
阿里这次还引入了GDN和QSA混合注意力机制,在百万Token长上下文场景下能提速8倍以上。更狠的是训练成本较前代Qwen3.7-Plus降了近90%。
智谱这边,GLM-5.3-Flash总参数320B,单Token激活18B,也是MoE。和Qwen不同的是,GLM-5.3-Flash是原生多模态模型,文本、图像、视频都能处理。采用稀疏注意力加线性注意力混合架构,走的是"参数更大但效率也高"的路线。
价格才是重点
Qwen3.8-Flash的API定价:输入每百万Token 0.8元,输出2.7元。发布后不到24小时又降了一刀。
这个价格是什么概念?大概只有DeepSeek-V4-Flash的三分之一。对开发者来说,这意味着同样的预算可以跑三倍的调用量。
智谱GLM-5.3-Flash的定价目前还没公布具体数字,但官方口径是"相比前代大幅降低",而且开源权重,你可以自己部署。
两家同一天打价格战,受益的是所有做AI应用的人。
为什么Flash成了新方向
2025年的时候,大模型竞争的主旋律是"谁更大"。参数从70B卷到400B再到万亿,各家都在benchmark上较劲。
到了2026年,风向变了。企业用AI最大的瓶颈已经不是"模型不够聪明",而是"推理太贵"。当你每天要处理几百万次API调用时,每Token贵一毛钱,一个月下来就是几十万的差距。
Flash模型的逻辑很简单:用MoE架构把激活参数压到最低,在"够用"的智能水平下把成本打到地板。不是追求最聪明的模型,而是追求最划算的模型。
对开发者意味着什么
说句实在话,大部分AI应用根本不需要GPT-5.6 Sol那个级别的智能。你做客服机器人、做文档摘要、做代码补全,用Flash级别的模型完全够了,但成本能降一个数量级。
更便宜意味着更多场景变得可行。之前因为成本犹豫的中小企业,现在可以放手试了。之前只在核心业务用AI的公司,现在可以把AI扩展到边缘场景。
这就是Flash模型最大的价值——不是让最强的模型更强,而是让更多事情变得"用得起"。
开源是另一个关键信号
两家都选择了开源。Qwen3.8-Flash权重放到了HuggingFace和ModelScope,智谱GLM-5.3-Flash也是完全开源。
开源意味着你可以自己部署,不用被API价格绑架。对大公司来说,自建推理集群可能比调API还便宜。对研究人员来说,开源权重意味着可以在上面做微调和二次开发。
2026年的大模型竞争,已经从"比谁更聪明"变成了"比谁更便宜"。Flash模型不是终点,但它标志着推理成本正在成为新的竞争维度。对开发者来说,这是好事。
智谱GLM-5.3-Flash的原生多模态是亮点,320B总参数里图文视频都能处理,这个覆盖面比纯文本的Flash模型广多了 ?
便宜就是正义,我选择把省下来的API费用拿去摸鱼 ☕
开源权重才是真正的杀招。自己部署的话推理成本可以进一步压缩。我现在跑Qwen3.8-Flash,用一张4090就能撑住日均百万级调用。之前想都不敢想。
6B激活参数跑出125B的效果,这个性价比确实离谱。我跑了下benchmark,在代码生成任务上和某些闭源模型差距不到5%,但价格只有十分之一。对中小团队来说这就是最实际的选择。
从商业角度看,Flash模型打的是'用量战'而非'质量战'。单价低了,但调用量会上去。阿里的策略很清晰——用低价模型圈住开发者生态,等Qwen4正式发布再收割高端市场。