游乐游手机版
首页/AI热点日报/热点详情

DeepSeek Harness开源两天获93K星,真正值得关注的三件事

类型:热点整理2026-08-16
48小时93K星!DeepSeek Harness开源爆火,非模型而是让模型当agent的引擎外壳,真正值得关注的是这三点差异。核心内容:1 DeepSeek Harness的定义:模型为发动机,harness是可扩展的agent外壳2 48小时内star fork数据:93038星、8521

48小时93K星!DeepSeek Harness开源爆火,非模型而是让模型当agent的引擎外壳,真正值得关注的是这三点差异。
核心内容:
1. DeepSeek Harness的定义:模型为发动机,harness是可扩展的agent外壳
2. 48小时内star/fork数据:93038星、8521 fork,远超初始数据
3. 与OpenAI/Codex、Google Gemini CLI的本质区别:开源可扩展零件而非定死架构

这篇稿子我8月13号晚上就写完了,压了两天没发。

现在回头看,幸亏压了。这两天里,我原稿里的数字全过期了。

13号晚上我抓到的是28199个star,当时觉得这数字已经够唬人了。刚才我又去GitHub的API上拉了一遍——

93038个star,8521个fork。48小时。

我把这两个数字并排贴在这,你自己感受一下。

先说清楚这东西是什么

一句话交代:DeepSeek这次开源的不是模型,是让模型能当agent干活的那套外壳,官方名字叫DeepSeek Harness。

模型是发动机,harness是整台车。你把V4的API key给我,我什么也干不了;但你给我一个跑着V4的Claude Code,我能让它自己读代码、改文件、跑测试、提commit。中间那一大堆东西——工具怎么调、上下文怎么管、会话怎么存、出错怎么重试、界面长什么样——就是harness。

今年三月我开始写harness系列的时候,中文圈聊这个的人还很少,留言里问得最多的是"这不就是agent框架吗"。现在DeepSeek官方产品页首屏就写着"Everything is a plugin",Hacker News主帖底下709分292条评论,没人再问这个词是什么意思了。半年时间,一个词从行话变成了常识。

它不是第一个,这一点得先说清楚

这两天有不少说法,讲DeepSeek是第一个下场做开源harness的模型厂商。这个说法不成立。

OpenAI的Codex CLI,2025年4月就开源了,Apache-2.0协议,起初是TypeScript后来整个用Rust重写。Google的Gemini CLI,同年开源,Apache-2.0,TypeScript。两家都比DeepSeek早一年多,DeepSeek是第三个。论体量前两位还领先:Codex CLI 105954个star,Gemini CLI 106521个,DeepSeek Harness 93038个——只不过前两位跑了一年多,后者用了两天。

把三家摆在一起,DeepSeek这次的动作反而显出了真正的不同:区别不在开不开源,在开源的是什么。

Codex CLI和Gemini CLI开源的是一个产品的源码。能读、能改、能自己编译,但架构定死,想扩展只能走人家预留的口子——Codex是AGENTS.md加MCP,Gemini是extensions加MCP。我特意翻了Gemini CLI的README,通篇只提Gemini模型,那句MCP支持写的是"用于自定义集成",接的是工具,不是换模型。

DeepSeek Harness开源的是一套能拼出harness的零件。models、tools、skills、sessions、sandboxes、filesystems、loops、orchestration、UI,九类东西全是插件,底下只有一个叫Cordis的内核负责挂载、卸载、依赖注入。agent的主循环是插件,界面是插件,连模型本身也只是一个插件。

拿车打比方:前两家给你一辆车,还附赠图纸;DeepSeek给你一条产线。

(多说一句,上面那份九类清单我是从官网产品页扒的,GitHub的README里没有。这一点后面还要说。)

93K星要放在什么坐标里看

上一季我拆过的Hermes Agent七周95K、Superpowers半年121K,都是个人开发者靠口碑滚出来的。DeepSeek Harness两天93K是另一种打法,厂商品牌加上憋了三个月的社区期待,没有可比性。star这东西,前三天看的是关注度,三个月后看的才是留存。

但真正让我盯着看了半天的,是另外三个数字:

Codex CLI:12594个open issue。
Gemini CLI:835个。
DeepSeek Harness:0个。

不是因为它没bug,是因为issue区根本没开。README里写得很清楚,反馈和bug报告走GitHub Discussions或者Discord。

我又看了眼最后推送时间:停在8月13号13点,也就是开源当天中午。93038个star、8521个fork砸进来的这两天,主仓库一行代码都没推过。

这两件事拼在一起,说明一种很具体的姿态:代码是"扔出来"的,不是在开源社区里"长出来"的。DeepSeek一向如此,他们开源模型权重也是这个风格——东西给你,怎么用你自己琢磨,别指望我跟你在issue区一条条对线。

我不觉得这是黑点。developer preview阶段,README自己都用全大写吼着"会有兼容性破坏式变更",先把issue区关掉避免被淹,是合理的运营选择。但对着"开源"这两个字,心里得有个分寸:代码开源和开发过程开放,是两回事。Codex CLI那12594个open issue看着像屎山,那是一年多里真实用户和维护者互相拉扯留下的痕迹;DeepSeek Harness的0,是干净,也是还没开始。

同一天,还发生了另一件事

这是我压稿两天最大的收获——13号那天,DeepSeek不只干了开源这一件事。

同一天,V4-Pro正式版发布。同一天,API涨价通知发了出来,8月16号生效。

引Engadget的数字:V4-Pro的输出token,从每百万0.87美元涨到峰时3.96美元,四倍半,谷时1.98美元。V4-Flash的输出,从0.28美元涨到峰时1.32美元,四倍七,谷时0.66美元。从此引入峰谷两档,以前那个一口价没了。不同token类型涨幅不一样,多家媒体报道里最高的一档到了1100%。

官方理由是"更合理地分配资源"。翻译一下:卡不够用了,用价格把你们赶到半夜去跑。

为什么这件事对harness这个话题这么关键?

因为我13号那版初稿里,用了一堆社区数据论证"DeepSeek是被社区推着下场做harness的",其中最扎眼的是r/DeepSeek上那个1772个赞的帖子:「DeepSeek的输出token比Claude Opus 4.8便宜28倍」。评论区没人质疑数字,大家聊的都是"那我为什么还要付Claude的钱"。

16号起,这个28倍要重算了。那帖说的是Flash,Flash输出峰时涨了四倍七,如果Opus那边价格不动,28倍在峰时会缩到6倍上下——这是我按公开价格粗算的,谷时另说。

还有张890个赞的梗图,配文大意是:别人用着又贵又体面的opus和fable,一副专业人士的样子;你用着flash,但你把harness调到跟大模型打平。

这张图是整件事的题眼:模型的差距,可以用harness补回来。

现在再看,成色变了。模型便宜到几乎白送的时候,"用harness补差距"是一种精打细算的快感;价格涨上来还分了峰谷,这件事就从省钱变成了必须省。开源一个能把每个环节都拆开优化的harness,和把API价格提上去,同一天发生,我不觉得是巧合。

至于DeepSeek为什么非得亲自造这台车,下一篇专门讲。

Everything is a plugin,一句话预告

技术细节留到第三篇,这里只交代我的第一反应。

看到"everything is a plugin"这行字,我第一反应不是兴奋,是警觉。

之所以会特别关注这一套,是因为对这类架构已经非常熟悉。微内核加插件总线,Eclipse 的 OSGi 采用的就是这种思路。早年做企业级产品时,曾深入研究过 OSGi 的 classloader 隔离机制,复杂程度相当高。它的优势在于极致灵活,但代价同样明确:复杂度不会消失,只会转移到插件边界的契约设计上。例如版本地狱、废弃插件处理,以及缺乏统一治理导致的失控问题,往往都会逐步暴露。这些典型问题 DeepSeek 是否真正避开了,第三篇细拆。

上手命令倒是简单:

npx @deepseek-ai/dsh web

在浏览器中访问127.0.0.1:3080后即可打开界面。我在13号晚上已经顺利跑通,配置好自己的API key之后,也随手投了一个小任务做测试。先说一个可能和不少人预期不同的判断:它不是冲着替代Claude Code去的。界面刚打开时,很多人可能会有些疑惑,因为它并不是以“开箱即用、尽量把使用门槛降到最低”为目标设计的;相反,它默认使用者是来拆解、研究和动手调整的。这一点与Claude Code那种“装完就能直接干活”的产品感,走的是完全不同的路数。

HN和Discussions里在吵什么

HN主帖从13号的242分107评论,涨到现在的709分292评论。

夸的那派,最高赞那条抓的点很锋利。他说DeepSeek Harness把模型看到的一切都记进一条只增不改的会话日志——system prompt、推理过程、工具调用和返回、子agent调度、每一次上下文注入,全在里面。然后补了一刀:这跟那些把推理轨迹加密或者混淆掉的美国模型形成了鲜明对比。

这一刀扎得准。你用Claude Code,模型的完整推理轨迹是看不全的;OpenAI那边的推理模型更是明说了原始思维链不对外。

底下有人对着这个功能撇嘴,"就是些日志罢了"。这句我不同意,而且不同意得很坚决,第四篇专门反驳。剧透一句:做过金融系统的看到append-only这四个字,应该条件反射想到event sourcing。

骂的那派也不客气,文档写得烂是最集中的吐槽。这个批评我只接一半:README确实寒碜,除了安装步骤和一句"everything is a plugin",连哪些东西是插件都没列。但我翻了仓库的docs目录,二十多篇文档躺在那儿,架构、插件模型、扩展点设计、工具调用流水线、术语表、教程一应俱全,多数还配了中文版。所以不是没写文档,是门面没做好——有人骂完就走了,其实往里走两步东西全在。

Discussions区画风跟HN完全不同。热度最高的两个帖子是"DeepSeek Harness 微信交流3群"和"6群",64条和25条回复;技术贴排头的是"Session resume fails",讲provider注册表冲突导致会话恢复失败。官方还专门开了个"Terminal Benchmark 2.1提交通道",在Discussions里收benchmark提交,这个动作信息量不小,第六篇细说。

一个93K星的国际项目,最活跃的讨论是中文微信群。这个现象本身值得记一笔。

这一季怎么读

上一季十八篇,我拿八个项目铺了一张harness的全景图。这一季只干一件事:把DeepSeek Harness这一个项目拆穿拆透。

十篇,四个板块。前两篇讲发生了什么、DeepSeek为什么非做不可。中间五篇是硬骨头——插件内核怎么设计的、事件流藏着什么野心、模型凭什么也能当插件、benchmark为什么现在才敢公开跑、712个报名项目背后是什么打法。第八第九篇把它放回全景图里横着比,该下的判断一个不躲。最后一篇我自己上手,跑通、写插件、把老资产往里搬,能兼容多少如实报告。

每一篇我都会拽一个具体的对照物来比——Claude Code那八个写死的hook钩点、DeepAgents的middleware插槽、pi-mono的Extension机制、ECC那套跨九个harness的适配层,还有这篇里刚请进来的Codex CLI和Gemini CLI。光讲一家的设计,读者记不住,也判断不了好坏。

赶时间的:想知道值不值得上手直接跳第十篇,想搞明白架构第三第四篇是主菜,关心行业格局第九篇观点最重。

最后

压稿这两天,我把28199改成了93038,补了一整段涨价的事,还把几条二手消息挨个回原始出处核了一遍——有一条"社区最大的抱怨是没有终端界面"的说法,我翻遍Discussions没找到对应帖子,直接删了。这种时候写快不如写准,两天后没人记得谁先发,但错的数字会跟着你很久。

有件事倒是没变。八月十三号这一天,一家模型公司同时干了两件事:把API价格提上去,把整台车的图纸扔出来。

模型的钱要照收,但车怎么造,你随便拆。


登录查看剩余 70% 内容

来源:https://www.53ai.com/news/OpenSourceLLM/2026081542506.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。