8月12号到13号这两天,DeepSeek 搞了个大新闻,又搞砸了一个大新闻。

大家关注的都是 V4 Pro 正式版发布不到 24 小时就被紧急撤回——实测性能和官方宣传差距太大,翻了车。

但很少有人注意到,就在 V4 Pro 翻车的同一个晚上,DeepSeek 悄悄开源了另一个东西,叫 DeepSeek Harness(简称 DSH)。

这才是真正值得聊的。

如果说 V4 Pro 是 DeepSeek 想证明"我的模型也能打",那 Harness 就是 DeepSeek 在说——模型之外,我还要把 Agent 的那层壳也给开源了。

R1 当年把闭源模型的推理溢价打了下来。这一次,DSH 想把闭源 Agent 外壳的溢价也打下来。

Harness 到底是个什么东西?

先搞清楚一个最朴素的问题:大模型能思考,但它没有手脚。

你让 GPT 写一段代码,它能写出来,但不能自己跑起来、不能调试、不能改文件、不能联网查资料。ChatGPT 加了 Code Interpreter 倒是能跑了,但那个沙箱是黑盒的,你没法往里插自己的工具。

Harness 就是那个"手脚"。

官方给的定位很简单:Model + Harness = Agent。模型负责思考推理,Harness 负责实际执行。

你可以把它理解成一个"Agent 操作系统"。管理项目和文件、跑长任务、调度多个子 Agent、管理上下文、联网搜索、调用外部工具——所有这些本该由 Agent 干的事,Harness 都给你搭好了架子。

但这不是重点。

重点是它的设计哲学:一切皆插件(Everything is a Plugin)。

这句话不是营销话术,是字面事实。拆过源码的开发者确认:模型、工具、技能、会话、沙箱、存储、Agent Loop、调度、UI,全是插件,挂在同一个 Cordis 底座上,没有特权内核 CSDN

现在市面上几乎所有 Agent 产品——Claude Code、OpenAI Codex、Cursor——都是"整机"交付的。模型、工具、执行循环、UI 全部耦合在一起。厂商给你什么,你用什么。

Harness 把这事反过来做了。

"一切皆插件"到底是什么意思?

DeepSeek Harness 基于 Cordis 插件系统构建。Cordis 不是个 Agent 框架,它是个元框架——只负责插件的加载、卸载和依赖关系,不掺和任何具体业务。

它的设计思想来自北京大学和 DeepSeek 联合署名的论文《A Programming Paradigm for Spatiotemporal Composability》(时空可组合性编程范式)。核心回答一个问题:当系统里的每个模块都可能被替换时,怎么保证它们还能正确协作? CSDN

整个架构分三层:

第一层:Cordis 内核。 极简,只管插件的加载、卸载、依赖注入和事件通信。它什么具体活都不干,但所有插件都挂在它上面。

第二层:插件层。 所有 Agent 能力全在这里——模型适配器、文件系统、Shell 执行、网页检索、技能(Skills)、会话管理、沙箱、存储、循环调度、Web UI……目前官方仓库里有 238 个工作区项目、219 个包 人人都是产品经理

第三层:配置层。 开发者通过 YAML 配置文件组合插件,不用碰源码。想换模型?改一行配置。想换工具?换一个插件。想换 UI?社区已经有 TUI、移动端 UI 的插件了 头条

更狠的是,连 Agent Loop 本身都是插件。也就是说,你觉得 DeepSeek 默认的执行循环不好?你可以自己写一个换掉它,其他模块不用动。

这跟传统 Agent 框架的区别,可以用一个比方:

传统 Agent 是一台出厂装好的电脑,你最多插个 U 盘。

Harness 是一块巨大的洞洞板——芯片、内存、硬盘、屏幕、键盘,全靠你自己插。

四个模式,覆盖从极简到全功能

DeepSeek Harness 提供了四种执行模式,适合不同场景 Gigazine

Standard 模式:全套工具集,日常开发用这个。

Code 模式:用模型生成的代码来协调多次工具调用,更灵活但也更复杂。

Minimal 模式:只给 Shell 和文件编辑器,用来做基准测试,排除框架差异测模型本身的能力。

Creator 模式:可以检查当前执行环境、在内存里测试 Cordis 插件,适合做插件开发。

特别有意思的是 Minimal 模式——DeepSeek 自己在 7 月 31 日 V4 Flash 更新的时候,就已经用 Harness 的 Minimal 模式来做代码智能体评测了,相当于"用自家的框架跑自家的模型测自家的分",内部验证早就做了 深科技

另一个值得单独说的设计是可追溯性。Harness 采用只追加(append-only)的会话日志,模型看到的一切——系统提示词、思维链、工具调用与结果、子 Agent 调度、每一次上下文压缩——全部完整记录。

上下文压缩不会删除原始历史,只是用"替换事件"改变模型此后看到的表象。你可以在 Trajectory 视图里按来源追溯,支持恢复、分叉、检索和回放。

官方把这个原则概括成一句话:模型可见,即已记录。 百科

最狠的一步:把竞争对手变成你的插件

DeepSeek Harness 有个很鸡贼的设计:它可以把 Claude Code 和 OpenAI Codex 当成子 Agent来调用 MindStudio

什么意思?就是你在 DSH 里面编排工作流,遇到难搞的任务,可以直接丢给 Claude Code 去做,做完了结果再回到你的主流程里。

这一下,DSH 的定位就变了——它不是 Claude Code 的竞品,它是Claude Code 的调度器

你想啊,DeepSeek 为什么要这么做?

因为它卖的是模型,不是外壳。Claude Code 再好用,用的也是 Anthropic 的模型。但如果 DSH 成了事实标准,开发者都用 DSH 来编排 Agent 工作流,那模型选型就变成了一个配置问题——今天你用 Claude,明天觉得 DeepSeek 够好了,换一行配置就行。

外壳越开放,模型的竞争就越激烈。而价格战,恰好是 DeepSeek 的主场。

这步棋,有点像安卓当年的策略——我不靠操作系统赚钱,我靠生态和规模赚钱。操作系统越开放,用的人越多,我的核心盈利点(对 DeepSeek 来说就是模型 API)就越吃香。

这不是技术发布,是战略布局

把 V4 Pro 和 Harness 放在一起看,你会发现 DeepSeek 的套路非常清晰。

V4 Pro 想证明的是:我的模型能力已经接近第一梯队了,但价格只有几十分之一。

Harness 想证明的是:Agent 的外壳不值钱,应该开源变成公共品,竞争回到模型本身的能力和价格上。

两步棋,一个目的——把 AI Agent 的成本打下来。

R1 当年把推理的溢价打下来了,让全世界知道"推理不是闭源的特权"。现在 DSH 想把 Agent 外壳的溢价也打下来,告诉大家"这层壳也不是闭源的特权" 博客园

而且从实测来看,自己的模型配自己的 Harness,确实比硬套别人家的壳顺手。在 DSH 里,模型、工具、缓存、Trajectory 日志是一套一起设计的,有开发者跑出来 99% 的缓存命中率——这不是随便哪个第三方外壳都能喂出来的。

缓存命中率意味着什么?意味着成本。Agent 编程场景里,大部分 Token 都花在重复读取上下文上。缓存命中率从 80% 提到 99%,成本可能差一个数量级。

写在最后:Agent 的"安卓时刻"来了吗?

DeepSeek Harness 上线不到一天,GitHub Star 就冲到了9万。上一个这么猛的还是全民小龙虾OpenClaw.

这个热度说明什么?说明开发者等这套东西等很久了。

现在的 Agent 市场,有点像智能手机早期的功能机时代——每个厂商都做整机,你买了诺基亚就不能用安卓的应用,换品牌意味着全部重来。Claude Code 有 Claude Code 的生态,Codex 有 Codex 的生态,互相不通。

DSH 想做的,是 Agent 时代的安卓——一个开放的、可插拔的、不绑定任何厂商的运行时底座。

当然,v0.1 开发者预览版,路还很长。Bug 肯定有,生态还在早期,插件质量参差不齐。安卓也不是第一天就打败塞班的。

但方向这个东西,一旦走对了,速度会比所有人想象的都快。

R1 让推理变得便宜,DSH 想让 Agent 变得自由。

如果这两步都走成了,DeepSeek 就不只是一个"便宜的模型厂商"了。

它会成为 Agent 时代的底层玩家。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐