8月20日深夜,OpenRouter上悄悄出现了一个匿名模型。没有发布公告,没有技术报告,连开发者署名都没有。结果上线第一天就登顶榜首,刷新了单日用量历史纪录,直接终结了DeepSeek连续56天的霸榜。
它叫Ox Alpha,"Ox"就是"牛"的意思,国内网友直接叫它"牛来"大模型。
参数表里藏着的狠活
先上核心数据:100万token上下文窗口,128K token最大输出,支持文本、图像、视频多模态输入,架构推测为MoE约744B总参数、40B活跃参数。预览期完全免费,不需要信用卡也不需要注册。
两个数字最扎眼。100万上下文意味着你可以把整个代码仓库、整本书、完整的技术文档一次性喂进去,不用再折腾RAG那一套拆文件、拼上下文的工程活。128K输出意味着它一次就能吐出一整个微服务模块或者一套完整的回归测试,不用再反复"继续写"。
做个对比,普通模型的上下文大概是一张办公桌,100万token的模型就是一个图书馆的库房,你甚至能把书架整体搬进去。
实测数据怎么样
从DeepSWE等用户的测试结果来看,Ox Alpha在编码和测试场景的表现相当能打。工具调用的出错率极低,69次调用只有1次失误。全量51469项回归测试零失败。跑分大约80%,超过了同期的多款旗舰模型。
截至8月24日,累计处理量超过180亿token。仅Hermes、Claude Code等前五大入口的累计用量就超过4万亿token。上线四天,被Bloomberg、TechCrunch等12家国际媒体报道。一个连名字都不公开的模型,热度直接拉满。
到底是谁家的模型
目前行业高度指向智谱AI的GLM-5.x多模态变体,但官方没有确认。这种"隐身发布"(stealth model)其实是AI圈这两年流行起来的一种策略:厂商在正式发布旗舰模型之前,先用匿名身份放到聚合平台上,让开发者在真实生产环境里做压测,收集数据,最后再揭晓身份、正式商业化。
半年内这已经是第五个stealth模型了,前面有智谱GLM-5、小米MiMo-V2-Pro、蚂蚁Ling-2.6-flash、长上下文方向的LongCat-2.0。Ox Alpha是其中反响最大的一个。
适合做什么,不适合做什么
推荐场景很明确:大型代码库审查(100万上下文是核心优势)、长流程Agent工作流(工具调用出错率极低)、回归测试辅助、前端界面生成与迭代。还有个有意思的场景:录屏排障,直接把屏幕录制当成调试素材喂进去。
不太适合的场景:对响应速度敏感的实时应用,中位延迟约4秒,偏慢;音频输入明确不支持;生产环境里处理敏感数据要小心,因为OpenRouter页面条款里写了"匿名提供商会保留提示和输出内容",跟"Zero-Retention"的宣传有点矛盾。
这件事的行业意义
Ox Alpha验证了一件事:免费加百万上下文这个组合拳的杀伤力。RAG的工程复杂度优势被大幅削弱,当你可以把整个代码仓库直接投喂的时候,很多人会重新评估自己的技术架构。
价格战也在加剧。DeepSeek涨价之后,市场对低价强力模型的需求本来就旺盛,Ox Alpha直接免费放量,等于精准收割了一波。如果确认是国内大厂旗舰,2026年下半年的大模型价格战只会更激烈。
对开发者来说,现在的正确姿势是:免费期内赶紧用它做积压的大型重构、全量测试、代码审查。但不要把它绑到生产关键路径上,免费期随时可能结束,匿名模型也存在下线或换皮更名的风险。先用起来,保持灵活。

4秒延迟确实有点拉,对实时应用来说太慢了。不过做代码审查和测试生成,多等几秒完全能接受。反正免费的,要啥自行车?
半年第五个stealth model了,这都快成行业标配了吧。匿名上线→真实流量压测→正式商业化,这条路确实比传统的发论文再商用的模式高效多了。
免费期赶紧用,别犹豫。我把手上积压了三个月的两个大型重构任务直接丢进去了,效果比我预期的好很多。但记住别提交生产环境的敏感代码。
51469项测试零失败这个数据相当炸裂。如果真是GLM-5.x的变体,那智谱在编码场景的实力被严重低估了。不过stealth model这个策略确实聪明,匿名上线反而制造了话题度。
100万上下文这个参数一出来,很多做RAG的团队估计要重新评估架构了。当你整个代码仓库可以一次性投喂的时候,RAG的工程复杂度优势就被大幅削弱了。但生产环境的敏感数据处理仍然是个问题。