8月14日晚上,阿里千问悄悄开源了一个27B参数的模型。没开发布会,没预热海报,就发了个权重文件。结果两天不到,Hugging Face下载量破百万,社区自发贡献了大约500个量化版本,直接冲上Trending榜首。
27B参数,凭什么炸场
先说结论:这是一个量化后17GB大小、家用显卡就能跑,但在编程和Agent任务上干赢了不少闭源旗舰的模型。
看几个关键跑分:SWE-bench Pro(软件工程)61.7分,超过Claude Opus 4.6 Max的53.4分;OSWorld-Verified(电脑操作)84.3分,超过Opus的72.7分;AndroidWorld(手机操作)81.9分,超过Opus的62.0分。这些可不是玩具测试,是实打实的Agent能力基准。
当然也有没赢的,比如GPQA Diamond(科学推理)89.2分,Opus是91.3分。Terminal Bench 2.1(终端编程)73.0分,Opus是78.2分。但考虑到人家参数规模差了不知道多少倍,这个成绩已经很离谱了。
架构上做了什么
Qwen3.8-27B用的是64层Transformer,其中16层是标准注意力,48层换成了Gated DeltaNet线性注意力。这个混合架构的好处是:处理长文本时显存消耗从O(n²)降到O(n)。所以它能原生支持262K上下文,通过YaRN扩展能到100万tokens。
另一个重点是原生多模态。不是后期拼上去的图像理解,是从训练阶段就把图像和视频输入融进去了。配合Agent能力,它不只是"看图说话",而是能看懂屏幕、操作电脑、帮你完成软件任务。
Apache 2.0协议,可商用,不收费。
本地部署的真实体验
社区实测下来,Q4量化后模型文件大约17GB。但注意这只是权重本身,实际运行还要加上KV Cache和推理激活值。24GB显存(RTX 4090)比较舒适,16GB能跑但上下文要控制,12GB只能玩玩短文本。
部署方式已经很成熟了:Ollama一行命令搞定,llama.cpp支持GGUF格式,vLLM适合多并发场景。社区还发现了一个提速技巧,用llama.cpp的多Token预测(MTP)功能,速度能比默认GGUF提高大约72%。
不过有个坑要提醒:这个模型默认开启高强度推理模式。简单问答也会先"想一想",导致响应巨慢。Simon Willison实测生成一个SVG花了21分钟。可以通过reasoning_effort参数调节,关掉推理后速度快很多。
对普通开发者意味着什么
一年前想在本地跑一个能干活Agent的模型,基本不可能。要么买不起卡,要么跑不动。现在27B到了"一台游戏本就能跑、还能干正事"的甜点区。
对数据敏感的个人或小团队来说,本地部署一个能力接近闭源旗舰的Agent模型,不再需要担心数据外泄、不需要为API付费、不需要依赖网络。
当然,量化版和官方全精度肯定有差距,硬推理和长任务更明显。官方跑分也需要更多第三方验证。但方向已经很清楚了:Agent能力正在从千亿级闭源模型,下沉到普通人买得起的参数规模。
这可能是2026年开源AI最重要的一个里程碑。不是因为它最大,而是因为它第一次让"本地Agent"变成了一个真正可用的选项。

关注一下MTP加速方案,llama.cpp社区已经验证能提速72%。再等几周社区优化到位,速度应该不是问题。
跑分赢了不代表体感赢了,量化版肯定有损耗。但27B能到这个水平,确实是开源的又一个里程碑。?
Apache 2.0协议商用无压力,这点对小团队太重要了。不用跟法务扯皮,拉下来就能用。
17GB就能跑Agent?一年前说这话没人信。现在开源模型进步太快了,闭源厂商的护城河越来越窄。
实测了一下,写代码确实能打,就是速度比API慢不少。大概15-30 tok/s,等得有点久。不过考虑到不用花钱、数据不出本机,这个trade-off可以接受。