Codex 开源 Harness、DSH 推"一切皆插件":Agent 时代真正在争的,是模型的"神经系统"

📌 作者按:8 月 13 日 DeepSeek 开源 DSH,8 月 19 日 OpenAI 宣布 Codex Harness 平台化并完整以 Apache-2.0 开源。一周之内,全球 AI Agent 的"底座"连续两次大动作。但 99% 的解读都停在一个误读上——"OpenAI 开源了 Codex"。本文基于官方仓库、开发者博客和多源技术拆解,把这件事的事实层、对比层、商业价值层、边界层讲透,并给出对开发者与企业最关键的几个信息差。


🎯 先钉死一个事实:开源的是 Harness,不是模型

"OpenAI 开源 Codex"这个说法 80% 正确,但省略了最关键的 20%。

真正开源的是 Agent 的执行框架(Harness),不是 GPT 系列模型权重。这一点 OpenAI 官方文章《Codex as a platform: build on the open agent harness》写得非常清楚:"The open-source layer is the harness and integration surface; model access and managed services remain separate."(开源层是 Harness 与集成接口;模型访问与托管服务保持独立。)

把边界钉死:

类别

是否开源

说明

Agent 执行框架(codex-rs/core)

✅ Apache-2.0

Rust 实现的 Agent Loop:上下文管理、工具调用、沙箱、审批、事件流

codex exec

✅ Apache-2.0

非交互入口,适合 CI/CD、批量脚本

Codex SDK(TypeScript / Python)

✅ Apache-2.0

编程式启停、恢复、流式读取 Agent 任务

app-server

✅ Apache-2.0

JSON-RPC 协议,业务应用嵌入 Agent 的核心接口

GPT-5.x Codex 模型权重

❌ 闭源

必须走 OpenAI API 或 ChatGPT 订阅

Codex Cloud / IDE 插件前端

❌ 闭源

云端托管服务和 VS Code/JetBrains 扩展本体未开源

gpt-oss 系列

✅ 开放权重

OpenAI 另一条开放权重线,可本地部署

时间线的关键修正openai/codex 仓库早在 2025 年 4 月 13 日就以 Apache-2.0 创建,Rust core、CLI、app-server 源码一直在里面 。2026 年 8 月 19 日不是"源码首次公开",而是 OpenAI 正式把 Harness 定位为平台层并文档化协议——app-server 的 JSON-RPC 协议被官方文档化,TypeScript/Python SDK 变为官方支持,OpenAI 明确邀请第三方在这个层上构建产品 。

💡 准确表述:OpenAI 把"让 AI 在业务里安全、可控、持久地干活的神经系统"免费授权给你改、商用;但"大脑"(GPT-5.6 系列模型权重)仍然是租的,一分不少 。


🔥 为什么这件事比"发新模型"更重要:Harness 的工程价值 > 模型的边际提升

OpenAI 在这波公告里给了一个反直觉的实证数据

同一个 GPT-5.6 Sol 模型,仅通过 Harness 的两项优化——保留推理链(retained reasoning)+ 上下文压缩(context compaction)——在 ARC-AGI-3 基准上分数从 13.3% 飙升到 38.3%,同时输出 token 减少到 1/6​ 。

翻译一下:Harness 层的工程优化,能让同一模型的智能表现提升近 3 倍,同时把成本打到 1/6

这意味着什么?Agent 时代的护城河,正在从"模型权重"转移到"运行时工程化能力"。正如 OpenAI 工程师在官方文章中所定义的:"模型负责回答,但周围那套执行系统才是 Harness"——它负责任务理解、跨轮次上下文维护、工具调用、进度暴露、失败处理、必要时请求人工审批,并最终返回有用结果 。

每一个严肃的 Agent 产品,最终都在重建这份清单。而现在,OpenAI 把这份清单的生产级实现开源了。


⚔️ Codex Harness vs DSH:两种哲学,两条路线

8 月 13 日 DeepSeek 开源的 DSH(DeepSeek Harness),与 8 月 19 日 OpenAI 平台化的 Codex Harness,构成了当下 Agent 运行时领域最值得对比的一对样本。

核心差异对照

维度

Codex Harness(OpenAI)

DSH(DeepSeek)

开源协议

Apache-2.0

MIT

架构哲学

Rust 单体 + 特权内核

Cordis 微内核 + 一切皆插件

模型绑定

深度绑定 GPT-5.x

模型无关,原生适配 40+ 厂商

当前状态

成熟产品,v0.149.0

Developer Preview v0.1,会有破坏性变更

外部代码贡献

不接受,迭代由 OpenAI 内部掌控

完整开放社区贡献

集成深度

三层:exec / SDK / app-server

插件化:模型/工具/会话/UI/基础设施全部可替换

子代理调度

自身作为执行层

可把 Codex、Claude Code 当子代理调度

两种战略的本质

OpenAI:Harness 开源 + 模型闭源 = 让生态围绕 OpenAI 模型生长(中心化)

DeepSeek:Harness 开源 + 模型中立 = 让任何模型都无法通过 Harness 锁住生态(去中心化)

腾讯科技的类比非常精准:如果制造汽车做比喻,Codex 是"核心发动机调校好了,你可以接入其它非核心组件,但需要和这个发动机适配";DSH 是"允许开发者连发动机都自己来组装" 。

CSDN 技术社区的总结更直接:"Codex 允许开发者扩展一台已经定型的机器人,DSH 允许开发者按照它制定的接口组装整台机器人"​ 。

一个反直觉的事实:两者不是零和,而是上下层互补

DSH 官方已经内置了 Codex 和 Claude Code 的子代理适配器,能从 PATH 把它们的二进制当子代理调度 。

现实里不少团队的玩法

  • Codex Harness 当执行层:利用 OpenAI 成熟的沙箱、审批、IDE 集成能力跑代码
  • DSH 当编排层:统一调度多种模型、保留全量会话日志、做跨 Agent 编排
  • DeepSeek V4 Flash 当廉价路由:日常代码生成/RAG/数据抽取走 V4 Flash(SCNet 30 元包月可跑)
  • GPT-5.6 Sol 当复杂推理路由:安全关键、多步推理任务才调用旗舰

这不是"选边站"的时代,而是"分层组合"的时代


💰 对用户与企业的五大商业价值

价值一:省去从零自研 Agent 运行时的巨额成本

过去企业要做生产级 Agent,最难的不是调模型,是写"让模型安全、可控、持久地跑在业务系统里"的那套执行系统——上下文压缩、工具调用编排、沙箱隔离、异常续跑、人工审批、流式事件推送。这套系统 OpenAI 内部由不到 10 人的团队花了 5 个月、写出超过 100 万行代码才打磨出来 。

现在这套系统以 Apache-2.0 许可完整开源,开发者可以自由修改和商用,无需开源上层业务代码​ 。

  • ❌ 过去:企业从零自研,耗时 6-12 个月,烧几百万
  • ✅ 现在:Fork openai/codex 仓库,基于 Codex Harness 改,2-4 周上线生产级 Agent

OpenAI 官方实证:税务合作伙伴用这套框架处理了 7000 份纳税申报表,准备时间缩短约 1/3,合规字段覆盖率从 25% 提升到 86%,准确率达 97%;Cisco 在云平台上用 Codex SDK 构建了 App Builder,业务用户可用自然语言生成自定义应用 。

价值二:三种集成路径,覆盖从脚本到产品的完整场景

Codex Harness 一次性开源了三个组件,对应企业不同深度的集成需求 :

1. codex exec(CLI)——轻量非交互

codex exec "Refactor the fetchData function in src/utils.ts to add error handling"

适合一次性任务、CI/CD、批量脚本。运行边界可控的 Agent 工作流,直接返回结构化输出,无需常驻进程 。

2. Codex SDK(TypeScript / Python)——编程式编排

import { CodexAgent } from '@openai/codex-sdk';
const agent = new CodexAgent({
  model: 'gpt-5.6',
  cwd: '/path/to/project',
  approvalPolicy: 'auto'
});
const thread = await agent.thread.start({
  input: 'Analyze performance bottlenecks in the repository'
});

适合把 Agent 嵌入自有应用,完整管控任务线程生命周期 。

3. app-server(JSON-RPC)——企业级产品嵌入

通过 JSON-RPC 协议,业务应用连接本地 Codex 进程,支持持久会话、事件流、中途打断、暴露 MCP 工具、Human-in-the-Loop 审批 。这是把 Agent 真正变成产品内置引擎的核心接口

Relay Logistics 的案例很有代表性:调度员在物流看板里选中延误货物 → Agent 自动拉取实时数据 → 提出改签方案 → 高风险动作强制人工审批​ ——整个过程没有聊天框,AI 是后台隐形助手。

价值三:Harness 自身优化 = 3 倍性能 + 6 倍成本下降

这是最反直觉的商业价值。OpenAI 官方数据:同一 GPT-5.6 Sol 模型,仅优化 Harness 的两项策略(保留推理链+上下文压缩),ARC-AGI-3 分数从 13.3% 飙升到 38.3%,输出 token 减少到 1/6​ 。

商业翻译

  • 不用升级模型,仅靠优化 Harness 配置,AI Agent 的准确性就能提升近 3 倍
  • 同时 API 调用成本降低到原来的 1/6
  • 在 Harness 层做工程优化,比盲目升级到更贵的模型更有性价比

价值四:告别"通用聊天框",AI 真正嵌入业务流

过去 AI 落地企业有两个痛点:(1) 所有 AI 应用都长一个样(聊天框),产品同质化,护城河极浅;(2) 员工必须在"业务系统"和"AI 聊天框"之间反复切换,复制粘贴上下文。

Codex Harness 开源解决了这个问题——它给企业三大控制权​ :

  • 界面控制权:AI 不再是抢占主界面的聊天框,而是业务系统里的隐形后台引擎
  • 上下文与工具控制权:企业内部 API、私有文档、业务数据通过 MCP 直接开放给 Agent
  • 安全与运营边界控制权:宿主应用管控 Agent 的文件访问权限,高危操作强制人工审批

商业翻译:企业终于可以在不改变员工工作习惯的前提下,把 AI 能力注入到现有的 ERP、CRM、税务系统、物流看板里——而不是强迫员工去用一个新的 AI 聊天工具。

价值五:Apache-2.0 许可,商用无忧

Apache-2.0 是商业最友好的开源协议之一 :

  • ✅ 可商用、可修改、可再分发
  • ✅ 无 copyleft 限制(修改后的代码无需开源)
  • ✅ 明确授予专利使用权
  • ✅ 可集成到闭源商业产品中

对比一下:Claude Code 是闭源(因 Source Map 泄露才公开了部分代码),DSH 是 MIT 协议——Codex Harness 的 Apache-2.0 在"专利保护+商业友好"上是最稳的选择。


⚠️ 三个必须知道的边界

边界 1|"DSH 倒逼 OpenAI 开源"是简化叙事

Codex 仓库 2025 年 4 月就已存在 ,8 月 19 日是"平台化宣言"而非"临时反击"。正确表述:DSH 的"模型中立+一切皆插件"范式,压缩了 Codex Harness 的独占优势空间,迫使 OpenAI 加快平台化步伐并明确生态策略​ ——但商业竞争看的不只是项目最初为何立项,更得看它推出以后实际上压缩了谁的空间。

边界 2|模型权重没有开源,调用仍要付费

Codex Harness 开源的是"让 AI 干活的神经系统",但"大脑"(GPT-5.6 Sol/Terra/Luna)仍闭源,必须走 OpenAI API 或 ChatGPT 订阅 。Apache-2.0 允许你改框架商用,但模型调用费一分不少 。

想完全离线/免费,要看 DSH(MIT,支持离线部署)或 OpenAI 的 gpt-oss 开放权重系列 。

边界 3|Apache-2.0 解决代码许可,不解决生产可用性

能商用、能二次开发,与能满足 SLA、审计、灾备、数据主权和责任追踪,是两组完全不同的问题 。企业落地仍需自建监控、日志审计、灾备、权限治理等配套体系。


💡 4 个真正的信息差

信息差 1:Harness 层的工程价值 > 模型层的边际提升

OpenAI 自家数据——仅靠 Harness 优化,ARC-AGI-3 提升 3 倍而不动模型 。Agent 时代的护城河,从模型权重转移到运行时工程化能力

这意味着在 Harness 层做工程优化,比追逐最强模型更有 ROI。一个中等模型 + 顶级 Harness > 一个顶级模型 + 平庸 Harness。

信息差 2:模型中立正在成为开发者默认选项

DSH 的"40+ 厂商插件化"架构,让模型可替换成为现实 。当开发者用 DSH 一行配置切换 DeepSeek/Claude/Gemini/本地部署模型,OpenAI 的"模型护城河"就被架空了。

未来 12-18 个月的预测:当 DSH 生态插件突破 10 万+、当"模型中立"成为开发者默认——OpenAI 将面临选择:要么开源更强的权重模型(如 GPT-OSS-200B/400B),要么接受"模型层商品化、Harness 层差异化"的新格局。

信息差 3:"便宜模型 + 聪明调度 + 验证层"正在成为开源 Agent 标准配方

CSDN DeepSeek 技术社区的洞察:"便宜模型 + 聪明的调度 + 一层验证"正在成为开源 Agent 的标准配方,而不是靠单一旗舰模型硬顶​ 。

具体数据:DeepSeek V4 Flash + 自验证,在 Terminal-Bench 2.1 上做到 88%,而旗舰档 Claude Opus 4.6 在同基准 2.0 版本上约 76.4%。旗舰几十分之一的价格,跑出同一区间的 Agent 成绩

信息差 4:两种 Harness 互补而非对立

dsh 已内置 Codex 子代理适配器 ——现实玩法是用 dsh 编排 + Codex 执行 + V4 Flash 路由。这不是"选边站"的时代,而是"分层组合"的时代


🛠️ 对开发者的实操建议

框架选择决策树

如果你的场景是

  • ✅ 快速交付 AI 功能、深度绑 OpenAI 生态、要生产级稳定性 → Codex Harness
  • ✅ 多模型自由切换、完全离线部署、深度定制 Agent Loop、自主可控 → DSH
  • ✅ 复杂多 Agent 编排 + 统一日志审计 → DSH 编排层 + Codex/Claude Code 子代理

成本优化的具体动作

  • 日常代码生成/RAG/数据抽取:用 DeepSeek V4 Flash(SCNet 30 元包月可跑),成本是 GPT-5.6 Sol 的 1/60
  • 复杂多步推理/安全关键:路由到 Claude Opus 或 GPT-5.6 Sol
  • 自建 AI 网关:用网关做按复杂度路由,不改应用代码

"Harness 集成商"是新兴创业机会

企业不懂如何把 Codex Harness 或 DSH 嵌入现有系统,这需要专业的集成服务。不做模型、不做框架,做"场景化 Harness 集成"——这是西安擎天智连"不造机器人,只教机器人干活"模式在 Agent 领域的复现。


🎯 一个判断

💡 Codex Harness 开源与 DSH 推出的真正意义,不在于"OpenAI/DeepSeek 开源了",而在于 AI Agent 的竞争维度发生了根本性转移:从"谁的模型最强"转向"谁的 Harness 最好用、谁的生态最自由"。

这个转移体现在三个信号:

信号 1:Agent = Model + Harness 成为行业共识

同一个 GPT-5.6 Sol 模型,搭不同的 Harness,最终工程落地效果可能有数量级差距。OpenAI 自己用 Harness 改进把 ARC-AGI-3 分数提升了 3 倍 ——这证明 Harness 的工程价值已经超过模型本身的边际提升

信号 2:开源模型的"性价比拐点"已经到来

DeepSeek V4 Flash 用 1/60 的成本达到 GPT-5.6 Sol 90%+ 的效果。当开源模型在关键基准上反超闭源旗舰,GPT-5.6 Sol 的"绝对领先"叙事就破了——7 月 30 日 OpenAI 把 GPT-5.6 Luna 降价 80%,就是这股压力的直接体现 。

信号 3:OpenAI 的应对策略是"分层开放"

  • 开放 Harness(8 月 19 日,Apache-2.0)
  • 开放次旗舰权重(GPT-OSS 系列,Apache-2.0)
  • 不开放最强旗舰(GPT-5.6 Sol 永远闭源)

这是典型的"用开源层锁生态,用闭源层保收入"的双轨策略 。

对开发者和企业的真正启示

  1. 押注 Harness 层的创新,而不是追逐最强模型——Harness 层的工程优化 ROI 远高于盲目升级模型
  2. 模型中立是架构第一原则——用 DSH 让模型可插拔,今天 DeepSeek V4 Flash、明天 GLM 5.2、后天本地部署 GPT-OSS-120B,框架一行不动
  3. 成本优化的主战场在"路由+验证",不在"选哪个旗舰"——便宜模型+聪明调度+验证层,是开源 Agent 的标准配方
  4. 两种 Harness 互补不对立——dsh 编排 + Codex 执行 + V4 Flash 路由,是生产环境的现实组合
  5. "Harness 集成商"是新兴创业机会——企业不懂如何嵌入,需要场景化集成服务

99% 的博主停留在"OpenAI 开源了!DeepSeek 也开源了!"的热闹层面。但作为开发者,你应该看透三层

  • 表层:两家都开源了 Harness,协议分别是 Apache-2.0 和 MIT
  • 中层:开源的是"模型外面的执行系统",模型权重都没开源;Harness 层的工程价值已被验证(3 倍基准提升)
  • 深层:AI Agent 竞争从"模型竞赛"转向"基础设施竞赛";护城河从模型权重转移到运行时工程化;模型中立成为新常态

这才是不跟风喊"开源万岁"口号,而是把产业链博弈、护城河转移、成本结构变化、开发者机会都讲透的技术判断力


📝 结语

回到文章开头的那个判断:开源的不是大脑,而是让大脑在企业里安全干活的神经系统

Codex Harness 与 DSH 的同周亮相,不是巧合,也不是简单的"中美对抗"——这是全球 AI Agent 底座的生态争夺战。OpenAI 用 Harness 开源换生态锁定,DeepSeek 用"一切皆插件"换模型中立。两者不是零和,而是共同把"Agent 运行时"这个新兴市场做大

而真正的赢家,是那些早早在 Harness 层做创新、在模型层保持中立、在场景层做深做透的开发者与企业。当模型商品化成为不可逆的趋势,当 Harness 工程化能力成为新的护城河——谁能更快地把"神经系统"植入业务,谁就赢得了 Agent 时代的第一个十年

📌 本文基于 OpenAI 官方博客《Codex as a platform》、openai/codex 仓库(Apache-2.0)、DeepSeek Harness 官方仓库与文档(MIT)、以及 Backgrind、Dev.to、CSDN、腾讯科技等多源技术拆解整理。Codex Harness 当前稳定版 v0.149.0,DSH 当前为 Developer Preview v0.1,具体 API 与能力以官方最新文档为准。


🏷️ 话题标签

#CodexHarness #DSH #DeepSeek #OpenAI #Agent运行时 #AI开源 #模型中立 #Apache2.0 #MIT #AI工程化 #OPC策展


如果你正在做 AI Agent 产品,或者考虑把 AI 嵌入企业业务系统,欢迎在评论区聊聊你的技术选型——是倾向 Codex Harness 的生产级闭环,还是 DSH 的模型中立与插件自由?我会挑典型问题在下一篇里展开解答。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐