上周AI圈最精彩的一出戏,不是哪个模型又刷新了跑分,而是智谱上演的一出"悬疑剧"。一个匿名模型悄悄空降OpenRouter平台,中文社区给它起了个外号叫"牛来",六天后智谱官宣:这就是GLM-5.3-Flash,MIT开源。次日股价高开1115港元。
但这篇文章不是来讲故事的。作为搞钱研究所,我更关心的是一个很实际的问题:百万token一块四,这个价格意味着什么?大模型价格战到底会走向哪里?
先把账算清楚
GLM-5.3-Flash的标准定价是每百万token输入0.8元、输出2.8元。限时折扣期更低:输入0.4元、输出1.4元,缓存命中只要0.115元。
什么概念?百万token一块四毛钱,大概等于一瓶矿泉水的价格,够模型给你产出上万字的内容。如果拿它和Claude Opus 4.8比,价格只有后者的四十分之一。
更关键的是性能:在Artificial Analysis综合智能指数上,GLM-5.3-Flash拿了57分,而DeepSeek V4 Pro在最大推理模式下是53分。便宜一个数量级的模型,综合分反而更高。这个性价比组合,确实有点炸裂。
为什么能把价格打到这么低
GLM-5.3-Flash用的是稀疏激活架构,320B总参数但只有18B激活参数。简单说就是模型整体很大,但每次推理只用到一小部分。再加上稀疏注意力和线性注意力的融合,长上下文的服务成本被大幅压缩。
这个技术路径的选择很聪明。不追求"全面最强",而是在特定场景下用最小的算力做最够用的事。对大部分商业场景来说,你不需要一个全能选手,你需要的是一个便宜、够用、响应快的工具。
价格战的终局在哪
大模型的价格战从2024年打到现在,趋势已经非常明确:推理成本在以每年一个数量级的速度下降。
这个趋势背后的驱动力有三个:模型架构优化(稀疏激活、量化等技术)、硬件迭代(更高效的推理芯片)、以及规模化效应(用量越大,边际成本越低)。三个引擎同时转,降价几乎是必然的。
那终局是什么?我觉得有两个判断:
第一,大模型会像云计算一样,最终变成按量计费的基础设施。就像你用水用电一样,用多少付多少,价格会稳定在一个很低的水平。到时候比拼的不是谁更便宜,而是谁的服务质量、稳定性和生态更完善。
第二,真正赚钱的不是卖token,而是卖解决方案。模型本身会逐渐变成薄利甚至微利的入口,真正的利润在垂直场景的交付能力上。这也是为什么智谱同步推了GLM Coding Plan,配套体验卡、企业方案,不是单纯卖API。
对创业者意味着什么
如果你在考虑用AI做点什么,现在是一个前所未有的好时机。
半年前用大模型做产品的成本,现在可能只有十分之一。以前你可能需要融资才能跑通MVP,现在一个人、一台电脑、加上便宜的API,可能就够了。
但也要注意一点:当基础设施足够便宜的时候,竞争焦点就转移到了应用层。你的护城河不在模型选择上,而在你对场景的理解、对用户的把握、以及交付体验的细节上。
我的判断
智谱这波操作很精明:先匿名霸榜造势,再官宣引爆话题,配合开源和低价,一箭四雕。资本市场也给足了面子,股价高开大涨。
但势头不等于终局。DeepSeek V4手里还有Agent工程闭环和国产算力适配的牌,Kimi K3的3万亿参数基座也在蓄力。这场仗还长着呢。
对普通用户和开发者来说,最好的策略就是不站队。谁的"当周特价"好用就用谁,把成本优势转化成自己的生产力。毕竟在2026年,顶级AI能力的价格曲线,下行速度比所有人的预期都快。

对创业者来说,模型便宜了不代表就能赚钱了。竞争焦点从'能不能做出来'变成了'能不能卖出去'。场景理解和交付能力才是真壁垒。
百万token一块四,一瓶水的价格 ? 以后写代码都不用学编程了,直接让AI写得了
先匿名霸榜再官宣认领,这个发布策略确实高明。半个月前GLM-5.3正式发布股价反而跌了4%,同样的团队同样的月份,换个策略效果完全不同。值得所有To B公司学习。
1/40 Opus的价格,这已经不是价格战了,这是价格屠杀。但对开发者来说,这是实实在在的好事。成本降下来之后,很多以前算不过来账的项目 suddenly 就可行。
320B总参数18B激活,这个稀疏激活架构的思路其实不新鲜,但智谱把它做到了开源前沿模型的水平,这才是关键。以后大模型竞争可能不是比谁参数大,而是比谁用更少的算力做更多的事。