编辑 | 王凤枝
8月13日晚,DeepSeek正式发布V4-Pro,并同步开源了自家的Agent Harness。当前版本仍处于开发者预览阶段,采用MIT协议。上线仅数小时,DeepSeek Harness的GitHub仓库就拿下了3万多颗Star,热度迅速攀升。

这不是又一个大模型产品,也不只是一个AI编程助手。DeepSeek这次开源的,实际上是让模型能够调用工具、读写文件、执行任务的那一层Agent系统。
不过,Star数量并不能说明全部问题。围绕它的讨论很快分成了两派:一派认为其底层架构非常强,另一派则直言它并不好用。
一、模型之外的那一层
先来说说harness这个词。
它的英文原意是“马具”,也就是套在马身上、让马能够拉车干活的那套装置。DeepSeek用它来命名产品,含义也很直白:模型就像那匹马,只有一匹好马还不够,还需要一副马具,才能把模型能力真正转化为可执行的生产力。
这副“马具”负责什么?主要就是那些看起来琐碎、但又绕不开的关键环节:记住前文上下文、决定调用哪个工具、文件如何读写、命令如何执行、任务进行到哪一步才算完成。模型如果缺少这些能力,就像一匹好马却没有缰绳和套具,只能在原地打转,难以真正完成复杂任务。
DeepSeek Harness要做的,就是把这副“马具”产品化、系统化。
它只坚持一条核心原则:一切皆插件(Everything is a plugin)。每一个组件都是独立模块,出问题可以替换,老旧了可以升级,想扩展能力也可以直接换件,而不需要把整个系统推倒重来。

在最新文档中还有一句很关键的话:这套系统里没有哪一块是绝对不可替换的。需要扩展功能时,只要在旁边挂上一个新插件即可。
它还预设了四档使用方式,从轻量到完整覆盖。最轻的一档只提供两个基础工具,目标是先跑起来;最完整的一档,则把读文件、写代码、联网搜索、分派助手协同执行等能力全部配齐;中间还有一档,专门把一些耗时操作打包后一次性执行;最后一档则留给希望深度自定义、自己动手修改系统的人。
最后一点也非常关键:这套系统并不绑定某一家模型。无论是Anthropic、OpenAI、谷歌,还是DeepSeek自家的模型,都可以接入。甚至本机已经能运行的Claude Code、Codex,也能被它调过来执行任务,只是这项开关默认关闭。
二、为什么说它架构强
看好它的人,观点大多集中在三个方面。
第一,是它把“插件化”真正做到了底层。
一个AI Agent或AI编程助手在执行任务时,通常会经历一套固定循环:看一眼、想一想、动一下手、再看一眼。像Claude Code这样的产品,也给开发者预留了不少扩展接口,但整套动作循环本身,通常还是由产品方预先设定。DeepSeek Harness更进一步:连这套循环本身都可以拆下来替换。
但这件事并不简单。就像一辆正在路上跑的车,想换轮子,通常得先停车;一个正在执行任务的程序,如果想替换其中某个核心模块,它往往已经与其他部分深度耦合:原来指向它的调用关系怎么办、正在运行的后台任务是否需要暂停、依赖它的其他部分是否要同步调整、新模块如果出错又该如何回滚。
DeepSeek专门为这类棘手问题设计了一层机制,名字叫Cordis。有开发者细读源码后发现,仅用于管理“纤维”——也就是程序中最细粒度执行线——的核心代码就有750行。相关论文里虽然堆满了范畴论符号,看起来偏理论、偏抽象,但它真正解决的问题非常务实:即使在不停机状态下,也能替换最核心的那一层;如果出错,还可以快速回退。
第二,是它给这个AI助手配了一个“黑匣子”。
模型看过什么、调用过哪些工具、在哪一步出错,都会按照顺序记录成一条不可篡改的流水账。任务中断后,可以基于这条记录原样续跑;也可以从中间分叉,换一条路径重新尝试。有开发者评价说,这比很多“任务一断,现场就丢”的Agent产品成熟得多。
第三,是它在执行期的安全边界上做得比较细。
DeepSeek Harness把文件沙箱与操作审批分开处理,默认配置为工作区可写、敏感操作需询问,并针对Windows、macOS和Linux分别提供不同的隔离实现。不过官方最新说明也很明确:这套沙箱目前主要限制的是文件操作,网络访问和进程可见性并不在其规则范围内。
这种灵活性究竟能达到什么程度?有开发者做了一个测试:在一次对话里,让这个助手先检查自己正在运行的服务,再用几行代码当场写出一个“抛硬币”小工具,然后直接调用它。从定义到实际使用,全部在同一次对话中完成,过程中无需重启。
三、开源Harness,涨价API:DeepSeek的商业算盘
便宜,一直是DeepSeek走红的重要原因之一。但这种“便宜”,不只是来自模型API的标价,也来自harness本身的工程设计。
一家名为Composio的机构曾做过横向测试:让同一个DeepSeek V4 Flash,在八个不同的harness上运行同一批任务。成本最低的是开源项目Pi,每个成功任务的平均推理成本约0.028美元;而Claude Code约为0.195美元。同一个模型、同一类任务,仅仅换一个harness,成本就能拉开接近七倍。
换句话说,Agent成本并不只取决于模型API价格,也取决于Harness的设计方式。缓存如何利用、工具如何调度、任务循环怎么执行,都会直接影响最终花费。
差距在哪?很大一部分来自缓存命中率。DeepSeek的缓存价格极低,有第三方harness报告称,与其配合时缓存命中率能达到99.93%。命中率越高,越少token需要走昂贵的主路径,单个任务的整体成本就越低。这才是“便宜”的工程来源:不是单纯标价低,而是整套运行机制把成本压得足够低。
但这种便宜,正在变贵。
同一天,DeepSeek宣布API调价:从8月17日0点(北京时间)起,采用峰谷定价。高峰时段为北京时间上午9点到12点、下午2点到6点,其余时段按低谷价格计算,低谷价格约为高峰的一半。官方给出的解释是“更合理分配资源”,用价格机制把开发者引导到更空闲的时段。

这次涨幅并不小。以V4-Pro为例:输出价格峰值从每百万token 6元涨到27元,达到原来的4.5倍;即便是低谷价也达到13.5元,是原来的2.25倍。输入价格(未命中缓存)在峰值时段则是原来的3倍。
涨幅最明显的,是缓存价格。V4-Pro缓存命中价从每百万token 0.025元,提升到峰值0.30元,涨了12倍。
真正值得关注的,也恰恰是这一项。前面提到,harness之所以便宜,很大程度依赖高缓存命中率:一旦命中,就能走极低的缓存价格。现在缓存价涨得最猛,等于把这套“依靠缓存降低AI推理成本”的逻辑重新改写了一遍。
把这两件事放在一起看,信号就很清楚了:Harness本身采用MIT协议开源、免费开放,但喂给它的算力成本却在同一天上涨。开源的是Agent框架,涨价的是模型算力。DeepSeek正在同时推进两件看似矛盾的事:一边开放Agent基础设施,一边调整模型调用价格。受到直接影响的,正是使用API的开发者,而这恰好也是Harness最想吸引的人群。
当然,即使涨价之后,DeepSeek相比Claude Opus 5这类模型仍然便宜不少。它不是突然变得昂贵了,而是不再像之前那样“极端便宜”。但可以确定的是,它确实开始回收一部分此前通过价格战打出来的优势。
四、夸和骂,指向同一个设计
回到DeepSeek Harness本身,好评与差评很快在社交平台上分成了鲜明的两派。
好评这一边,几乎都是“实测跑通”的案例。有人让它从零写出一个3D魔方,27分钟、52步、一次成功;也有人让它用纯C语言生成坦克大战,总成本0.12美元,结果是能运行、能玩、还有音效。
StreamNative的软件工程师YufanSheng直言:“用了一天DeepSeek v4 Flash,它的Harness比Kimi K3好上不少。”

差评这一边,问题也说得非常具体。
最集中的槽点,是缺少视觉能力。有开发者表示,“V4和DSH都被‘没有眼睛’严重拖累,模型总是执着于想‘看到’自己的工作结果”。还有人干脆让Harness自己给自己写了一个视觉插件,再调用别家的模型来补齐这部分能力。
其次是启动门槛偏高。一位署名BG-VC的开发者统计了冷启动过程:安装Node.js、打开终端、输入多条命令、访问本地地址、填写密钥、选择目录,实际解析了大约590个依赖,安装了500多个包,还弹出一个构建授权窗口。他的原话是:“程序员觉得这只是安装依赖,普通用户会觉得:这软件是不是坏了?”
还有它的“运行轨迹”页面也存在类似问题。页面会把助手执行任务的每一步全部展开:发过什么指令、调用过什么工具、传输了什么数据、花了多少时间,都会完整列出。对于排查故障、调试Agent流程的开发者来说,这是一座宝库;但对普通用户而言,它更像是信息噪音。
宝玉从“普通用户体验”角度总结了八条意见,挑几条来看:速度非常快,这一点值得肯定;但Flash模型太快,思考文字闪得厉害,应该做节流优化;Codex右侧的多Tab面板值得借鉴;运行轨迹对普通用户的价值有限,不应占据如此重要的位置;模型最好尽快支持多模态。

BG-VC的总结,可能是这几天最准确的一句评价:“底层架构很强,用户体验很差。”“它已经造出了一副很强的Agent骨架,但还没有长出面向人的皮肤。”

另一条长评说得更完整。开发者“鸭哥”在把DeepSeek Harness与Codex源码逐行对照后给出的判断是:对于绝大多数日常写代码的开发者而言,它重得有些没必要;但对那些探索“自进化Agent”的工程团队来说,它搭建出了一套目前其他方案仍然缺失的底层骨架。

还有一条安全提醒,虽然被压在大量好评之下,却值得单独拎出来。开发者Fan指出:一切皆插件,意味着装一个插件,本质上就是让它直接执行代码;如果没有签名机制、没有权限清单,那么一旦安装就相当于完全暴露。默认信任,也就意味着默认漏洞。

五、骨架已经搭好,皮肤还没长出来
其实,两派说的是同一件事。
看好它的人,看到的是它把每一层都做成了可替换插件:模型能换、工具能换、循环能换、沙箱也能换。批评它的人,看到的则是:它虽然把系统拆得足够细,但并没有为普通用户做好一层易用的产品外壳,复杂度几乎全部直接暴露出来。
从商业逻辑上看,这也是同一件事。最核心的底层框架可以免费开源,但同一天模型算力价格却上调;表面上说的是“一切皆插件、模型想换就换”,可真正用上一段时间就会发现,模型当然可以替换,但围绕Harness逐渐搭建起来的插件体系、权限配置和工作流,并没有那么容易迁移。时间越久,这一层反而越难动。DeepSeek现在真正想抢占的,正是这一层基础设施位置。
BG-VC最后一句话是:“DeepSeek Harness已经造出了一副很强的Agent骨架,但还没有长出面向人的皮肤。”宝玉@dotey则补了一句更直白的话:开发者愿意折腾插件的前提,是你的产品先拥有大量普通用户,否则新鲜感一过,很快就没人继续用了。
