DeepSeek开源Harness:造Agent的壳比造模型更重要了

AI风向标Agent 2026-08-14 16:23:55 5阅读 举报

8月13日,DeepSeek做了一件出人意料的事——没有发新模型权重,而是开源了一个叫DeepSeek Harness(dsh)的项目。MIT协议,一天之内GitHub星标冲破两万。

一句话理解dsh

它不是又一个Coding Agent成品,而是造Agent的那层"壳"。DeepSeek自己给了一个公式:Model + Harness = Agent。模型只负责预测下一步,真正决定Agent体验的是Harness——它决定模型能看到什么上下文、能调哪些工具、出错怎么重试、什么时候算完成。

这套框架的核心信条是"万物皆插件":模型、工具、技能、会话、沙箱、存储、循环、调度、UI,全部可插拔、可替换。不是外围加几个MCP工具那种程度,而是连Agent Loop和UI都能换掉。

为什么这件事值得关注

过去半年行业有三个痛点一直卡着。第一,模型强不等于Agent好用。一个没有Harness的强模型,本质上就是"很贵的自动补全"。第二,换模型要重写大量胶水代码,主流Agent的可扩展范围通常只在外围工具层,核心编排往往是焊死的。第三,DeepSeek自己的尴尬——模型是它家的,干活的手是别人家的,API文档列了十几家第三方Agent工具,唯独没有自家产品。

dsh的发布直接回应了这三个问题。它把Agent的全部能力拆成独立插件,插件之间通过"服务"和"事件"协作。换模型、加工具、调沙箱,逐组件替换,不用回改编排层。

四种运行模式,覆盖不同场景

dsh提供了四种运行时模式:Standard标准模式(完整工具组合)、Code/PTC程序化工具调用(模型生成TypeScript代码组合多轮调用)、Minimal极简模式(只保留bash和文件编辑器,专为基准测试设计)、Creator创造模式(在内存里试插件组合再存成预设)。

值得注意的是,DeepSeek官方跑自家V4-Flash的Coding Agent基准测试用的就是Minimal模式。这意味着以后看任何模型跑分,都得先问一句"它套的是哪层Harness"——同一个模型放进不同的壳,表现可能差出一大截。

行业信号:竞争焦点正在转移

dsh的发布不是孤立事件。同一周,阿里千问上线了Agent挑战平台"AI Arena",英伟达联合六大金融机构要撬动5000亿美元建AI数据中心。行业竞争的重心正在从"谁的模型跑分高"转向"谁的Agent跑得稳、扩得动"。

对开发者来说,dsh + MIT协议是目前开源Agent框架里迁移成本最低的方案。已经在用LangGraph或AutoGen的团队,可以逐组件替换,不用整体重写。对普通用户来说,这个变化最终会体现在Agent产品的可靠性上——当Harness层足够成熟,Agent犯错的概率会显著降低。

AI工程的战场,已经从模型本身转移到了运行时。DeepSeek这次开源的不是一个产品,而是一个新赛道的入场券。

版权声明:
作者:AI风向标
链接:https://www.aiddithome.com/p/77b44e45cc8e6.html
来源:Agent
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
5条评论
Prompt工程师小林
1楼 · 8小时前

已经跑起来了,插件化设计确实灵活,不过文档还不太全,有些插件接口得看源码才能搞明白。

AI摸鱼大王
2楼 · 8小时前

一天两万星,这速度比当年DeepSeek-R1还猛,说明Agent框架确实是刚需。

熵熵
3楼 · 8小时前

Model + Harness = Agent,这个公式简单但精准。模型是灵魂,Harness是身体,光有脑子没有手也干不了活。

算法老K
4楼 · 8小时前

同一个模型套不同Harness表现差距大这个观点太对了。我之前用同一个模型在不同框架里跑同样的任务,成功率差了快30%。以后看跑分确实得看套的是什么壳。

硅谷子
5楼 · 8小时前

万物皆插件这个设计理念确实激进,但也很务实。过去半年用各种Agent框架最大的痛苦就是换模型要重写一堆胶水代码,dsh直接把这个问题从架构层面解决了。MIT协议也很良心,商用无压力。