DeepSeek V4 Pro正式版Agent能力暴涨5倍:开源模型第一次摸到闭源天花板了

AI风向标Agent 2026-08-17 12:40:26 4阅读 举报

8月12日深夜,DeepSeek把V4 Pro从预览版正式转正了。模型版本号更新为DeepSeek-V4-Pro-0813。

说实话,看到这条更新的时候,我正在整理这周的AI工具清单,差点把它当成一次常规版本迭代略过去。但仔细看完官方的评测数据之后,我坐不住了。

这次的升级幅度,不是「小幅优化」那种,是真的在Agent能力上撕开了一个口子。

Agent能力:从预览版到正式版,涨了近5倍

先看最核心的数字。

在Terminal Bench 2.1这个测试上(衡量AI智能体在真实终端环境完成复杂任务的能力),V4 Pro正式版拿下87.9分。什么概念?全球第一的Anthropic Fable 5是88.0分,差0.1分。

而预览版的分数是72.1分。从72.1到87.9,涨了15.8分,提升幅度超过20%。

更夸张的是DeepSWE软件工程能力测试,从预览版的12.8分直接飙到62.7分,接近原来的五倍。这不是「优化」,这是「换了一层皮」。

100万Token上下文+开源,两个大杀器

V4 Pro正式版支持100万Token的上下文长度。对于Agent场景来说,这意味着一个复杂的代码仓库、一个完整的项目文档、甚至一整个对话历史,都能一次性塞进去。

更关键的是,模型权重开源,MIT协议。MIT协议。

这意味着你可以把它部署在自己的服务器上,跑自己的Agent工作流,不用给任何人交API费用,也不用担心数据泄露。

对于中小企业和独立开发者来说,这基本上等于拿到了一个免费的、企业级的Agent底座。

定价策略:缓存命中白菜价

API定价方面,每百万输入Token收1.32美元,每百万输出Token收3.96美元。

但真正值得关注的是缓存命中的价格:每百万Token只要0.44美元。对于大量依赖反复调用、长上下文输入的Agent工作流来说,缓存在成本里占比极高,这个价格几乎是「白送」。

硅基流动也同步上线了Day-0首发,三档推理强度可选(低/高/最大),灵活适配不同场景。缓存命中每百万Token同样0.44美元。

对行业意味着什么

过去Agent能力基本是闭源模型的天下。OpenAI的GPT-5.6、Anthropic的Fable 5,要跑复杂的多步骤Agent任务,几乎只能调它们的API。

V4 Pro正式版的出现,第一次让开源模型在Agent能力上逼近了闭源天花板。Terminal Bench 87.9分 vs Fable 5的88.0分,0.1分的差距,几乎可以忽略。

更值得关注的是,DeepSeek在Agent能力上持续加码的趋势。从V4系列开始,DeepSeek明显把重心从通用对话转向了工具调用和Agent工作流。这一版的跃升,说明这条路走对了。

2026年下半年,Agent赛道的竞争格局可能会因为这次发布发生微妙的变化。开源模型不再是「便宜但差一截」的替代品,而是真正能跟闭源模型掰手腕的选择了。

对开发者来说,这是好事。选择多了,价格自然卷下去,最终受益的是整个生态。

版权声明:
作者:AI风向标
链接:https://www.aiddithome.com/p/a2d44627c5fc6.html
来源:Agent
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
5条评论
AI摸鱼大王
1楼 · 6小时前

100万Token上下文+MIT开源+白菜价缓存,这三件套凑齐了,独立开发者的春天来了 ?

算法老K
2楼 · 6小时前

Terminal Bench 87.9 vs Fable 5的88.0,0.1分的差距。开源追到这个程度,闭源模型该紧张了 ?

诸葛量
3楼 · 6小时前

MIT协议开源这一点很多人可能低估了它的分量。意味着你可以把它部署在内网环境跑敏感的Agent任务,数据完全不出企业边界。对于金融、医疗这些对数据安全要求极高的行业,这比便宜多少钱都重要。

熵熵
4楼 · 6小时前

缓存命中0.44美元/百万Token这个价格值得细品。跑过Agent工作流的人都知道,同一个任务经常要反复调用、反复检索,缓存成本往往占总成本的大头。DeepSeek这定价策略明显是冲着大规模Agent部署来的。

硅谷子
5楼 · 6小时前

87.9分和88.0分差了0.1分,但这个差距在实际应用中几乎感受不到。真正重要的信号是:开源模型第一次在Agent能力上摸到了闭源的天花板。以前选开源就是接受'便宜但差一截',现在这个等式不成立了。