2026 年 8 月 13 日晚 20:30,DeepSeek 在 GitHub 上发布了 deepseek-harness(简称 dsh,logo 是一头黑色鲸鱼)。发布不到 48 小时,9.5 万 Star、8.8k Fork,开发者预览版 v0.1,MIT 协议开源。

但有一个关键误解需要先纠正:看到"Harness"这个词,容易以为它和 DeepSeek 之前的 GRPO 训练论文是一回事——一个模型强化学习训练框架。完全不是。

GRPO 出自《DeepSeekMath》(2024 年 2 月),讲的是模型训练阶段的强化学习策略。而 dsh 是一个 Agent 编排框架,它不训练模型,它让模型干活。
在这里插入图片描述

一句话说清:Model + Harness = Agent

如果把 Agent 比作一辆车,模型是发动机,那 Harness 就是方向盘、底盘、刹车和仪表盘的总成。它规定模型怎么接工具、怎么记上下文、怎么调度子任务、怎么回滚操作。

dsh 的底层是一个叫 Cordis 的元框架,源自 Koishi 聊天机器人生态。它只做一件事:管理组件之间如何组合、如何卸载、如何隔离。模型、会话、工具、沙箱、UI、甚至 Agent Loop 本身,全部是附着在 Cordis 上的插件——没有一行代码是特权核心。

三个核心亮点,每个都从不同角度挑战了现有框架的设计惯例

一切皆插件。 这可能是 dsh 最激进的设计决策。在大多数 Agent 框架中,Agent Loop(那个"思考→行动→观察→再思考"的循环)是写死在框架里的。dsh 把它也做成了插件,意味着你可以在配置层替换整个 Agent 的行为模式,不需要 fork 源码。模型的适配器、工具注册表、系统提示词、会话日志、沙箱、存储、调度,全部遵循同样的插件化逻辑。替换一个文件系统 Provider,所有依赖文件系统的能力(Bash、PTY、LSP)会自动整体迁移到新沙箱。

Append-only 会话日志。 模型看到的一切——系统提示词、思维链、工具调用与返回结果、子 Agent 的调度、上下文注入——全部写入一个仅追加的日志。这带来三个实际好处:你可以从任意节点恢复中断的会话;你可以分叉出一条新路径做实验而不污染原轨迹;你可以像 git log 一样审计 Agent 到底做了什么。这相当于给 Agent 加了版本控制。

模型无关。 dsh 原生支持约 40 家模型厂商,OpenAI、Anthropic、Google、Kimi 都在列。模型本身也是插件,换个 Provider 就切模型。搭配 DeepSeek 自家模型(V4-Flash 单任务约 0.2 元人民币),与海外旗舰模型有约 57 倍的成本差。实测中,有测试者跑出了 99% 的缓存命中率,长上下文下每提升一个百分点都是实打实的省钱。

在这里插入图片描述

30 秒看懂:DSH vs Claude Code vs Codex

维度 DeepSeek Harness Claude Code OpenAI Codex
开源 MIT 开源 闭源 CLI 开源,云端闭源
设计核心 Cordis 微内核,一切皆插件 26 个生命周期钩子 + 多端一体 内核级沙箱 + 多端一体
模型绑定 模型无关,约 40 家厂商 绑定 Anthropic 绑定 OpenAI
会话可复现 完整事件流可回放 不支持 不支持
成本 免费 + Token 费用 订阅 $20~$200/月 订阅 $20~$200/月

Claude Code 和 Codex 是成熟的商业产品,开箱即用、体验打磨到位。dsh 走的是另一条路:给你一个极度开放的骨架,你自己决定 Agent 长什么样。这不是一个"更好用的 Claude Code",这是一个"让你自己造 Claude Code"的工厂。

在这里插入图片描述

同步发布的论文,格局比产品更大

dsh 的发布不是孤立的。同步放出的还有一篇 88 页的论文《A Programming Paradigm for Spatiotemporal Composability》,由北大 Yifan Shi、张伟、DeepSeek 崔添翼联合署名。论文提出了两个核心概念:可逆效应(Revertible Effects)和响应式共效应(Reactive Coeffects)。

通俗但不精确地说:可逆效应让每次对环境做修改时,同时记录一条"怎么改回去"的逆操作,卸载时按后进先出的顺序逐个回滚,恢复到修改前的状态。响应式共效应让组件声明自己依赖什么,依赖没准备好就不激活,依赖退出时就通知消费者调整。

这两个机制合在一起,解决了一个长期困扰 Agent 系统的难题:Agent 的行为会修改环境(写记忆、改文件、调 API),下一个操作继承的是被改过的环境,导致"公平比较"变得不可能。dsh 的空间可组合性告诉你"这次波及了哪个局部子图",时间可组合性让你可以"加入 A→撤销 A→换成 B→比较边际效果"——这为 Agent 强化学习的信用分配提供了工程基础。

论文的大部分思想已经在 v0.1 中落地为可运行代码,包括完整的六态 Fiber 生命周期、UNLOADING 撤销顺序保证、以及被称为"创造模式"的自指工具链——Agent 可以在运行时检查、定义、运行、停止、删除自己的动态插件。社区有一个高赞判断值得注意:Cordis 范式本身的生命力,可能比 Harness 这个具体产品更长远。

在这里插入图片描述

但别急着上生产

v0.1 是开发者预览版,团队明确标注"破坏性变更频繁"。当前的形态是本地 Web UI(npx @deepseek-ai/dsh web),不是 CLI 桌面端,也没有 IDE 插件。文档偏薄,Cordis 的抽象概念对只想"跑起来"的开发者有劝退效果。工程上也有毛刺——Node 版本不兼容时会静默挂起不报错,长任务可能跑超过 30 分钟。

但这些都不妨碍你花五分钟尝鲜。打开终端,一行命令就能看到一头黑色鲸鱼在 127.0.0.1:3080 等着你。如果你此前以为 Agent 框架只能选 Claude Code 或 Codex 二选一,现在有了第三种思路:用插件组装你自己的 Agent。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐