过去两年,AI 行业几乎所有注意力都集中在同一个问题上:谁的模型更强?

GPT-5.6 Sol 发布、Claude Fable 5 面世、Gemini 3.5 Pro 预告——每一轮模型升级都能引起全球范围的讨论和关注。模型能力竞赛是这个时代最具观赏性的技术叙事。

但当我们把视线从"模型排行榜"移到"实际生产环境"时,一个不太好看的事实浮出水面:最强的模型并没有催生出最强的 Agent 落地效果。

扎克伯格承认进展不及预期。微软 Copilot 砍掉冗余功能。Fable 5 被下架后整个行业陷入反思。Anthropic 披露超过 90% 的 Claude Cowork 使用场景不是软件开发。

这些信号共同指向一个与主流叙事截然不同的判断:AI Agent 工程化落地的核心不是模型,是平台。


一、为什么模型不是护城河

1.1 模型能力正在快速商品化

2024 年,GPT-4 和 Claude 3 之间的差距是显著的。到了 2026 年,GPT-5.6 Sol、Claude Sonnet 5、Gemini 3.5 Pro、DeepSeek V4、Grok 4.5——这些模型的基准测试得分正在趋近。每一代新模型的"相对优势窗口"在持续缩短。

当一个行业的核心资产在半年的周期内从"独家优势"变成"入场标配"时,"模型能力"作为企业级产品的基础定位就不再成立。模型不是护城河,模型是地基。

1.2 企业不买模型,买"能稳定解决问题的系统"

企业采购 AI 产品的逻辑与个人用户截然不同。个人用户关心的是"这个模型能不能帮我写代码"——答案是能,就够了。企业关心的是一组更难的问题:

  • 这个工具能在我现有的合规框架里运行吗?
  • 出了错我能追责吗?
  • 我的团队需要多少培训才能用起来?
  • 供应商如果换模型了,我的工作流会中断吗?

这些问题没有一个能被"模型更强"所回答。它们需要的是一个平台——一个包裹在模型外层、提供可控性、安全性、可观测性和可迁移性的工程基础设施。

这是"Harness 即产品"这个概念的底层逻辑:在 AI 工程中,真正有价值的不再是原始模型能力,而是围绕模型构建的"管理平台"。


二、Harness 即产品:做 AI 时代的地基而非尖顶

2.1 什么是 Harness

在工程语境中,Harness 指的是"将某个核心能力包裹起来、使之可管理、可测试、可部署的支撑系统"。在 AI Agent 的场景下,Harness 就是模型之上的平台层——它不负责"生成更好的代码",它负责"让生成的代码更可控、更安全、更可审计"。

Harness 的核心功能模块包括:

功能模块

解决的问题

为什么模型本身无法解决

行为控制

Agent 能做什么、不能做什么

模型没有"边界意识",只有概率分布

操作审计

Agent 的每一步操作可追溯

模型不会自动记录操作日志

成本管控

Token 消耗可监控、可设限

模型不会告诉你"这次调用太贵了"

模型可迁移

更换底层模型时不中断工作流

不同模型的 Prompt 格式和输出特征不同

人造响安全

Agent 出错时可快速定位并回滚

模型不会自动生成补偿事务

2.2 为什么 Harness 比模型更重要

原因可以浓缩为一句话:模型的差异是暂时的,平台的差异是持久的。

你今天用 GPT-5.6 Sol,半年后用 GPT-6,两年后用全新的架构——模型会变、供应商会变、定价策略会变。但你在"行为控制""操作审计""成本管控"这些维度上积累的平台能力,不会因为模型的变更而失效。

投资于 Harness,就是投资于可持续的 AI 工程能力。 投资于单一模型,是在投资一个会持续贬值的资产。

敖行客 AT Work 的设计哲学就是这种观念的产物。它不宣称"我们用的是最强模型"——它宣称的是"无论你用什么模型,我们都能帮你管住它"。行为控制、操作追踪、成本管控、模型可迁移——这些是它作为 Harness 提供的核心价值,不绑定于任何单一模型提供商。


三、从行业案例看"模型 vs 平台"的胜负手

案例一:Meta — 最强的模型 ≠ 最佳的落地

Meta 内部 AI 一个月消耗 73.7 万亿 Token,这意味着 Meta 不缺模型能力。但扎克伯格的认错证明了一件事:模型能力再强,没有平台层支撑就无法进入生产。Meta 的问题不是"模型不够聪明",而是"Agent 的行为控制和安全审计没有到位"。

案例二:微软 Copilot — 重构的不是模型,是产品逻辑

微软 Copilot 的重构不是换了更强模型,而是砍掉了冗余功能、统一产品线、聚焦真实场景。苏莱曼透露 MAI 模型一周处理数万条提示——这个数字说明模型是够用的,但产品逻辑需要重塑。Copilot 的"断舍离"本质上是一次 Harness 层面的重构,不是模型层面的升级。

案例三:Fable 5 下架 — 最锋利的刀反而最先被没收

Fable 5 可能是 2026 年上半年最强的编程模型之一。它在被下架之前在基准测试上一路领先。但它被下架之后,企业并没有因此停止 AI 编程——它们切换到其他模型继续工作。这证明了:模型可以被移除,但使用 AI 的工作流不会因此崩溃——前提是你有一个不绑定于单一模型的 Harness。


四、企业 AI 工程化的三个平台层原则

从"Harness 即产品"的核心理念出发,可以归纳出企业 AI 工程化的三个平台层原则:

原则一:模型无关性

你的 AI 工作台应该能在不中断工作流的前提下更换底层模型。这不是技术上的 nice-to-have——这是应对供应链风险的刚需。Fable 5 被下架、Mythos 被限制出口——这些事件说明模型层面的不可抗力是真实存在的。平台层必须做到底层模型对上层用户透明。

原则二:操作可观测性

你的 AI 工具必须能完整记录 Agent 的每一次操作、每一步决策、每一次输出。这不仅是合规要求——没有可观测性,你就无法持续改进你的 AI 工作流程。

原则三:能控力优先于能力

在评估任何 AI 工具时,优先关注它的"能控力"——你能多精确地定义 Agent 的行为边界?你能在多大程度上干预 Agent 的决策过程?你能在多快的时间内中止一个失控的 Agent?——而不是关注它的模型有多强。能力决定上限,能控力决定底线。


结论

"Harness 即产品"不是一个新的概念。在半导体行业,EDA 工具链比单个芯片设计更持久;在云计算行业,Kubernetes 比单个容器运行时更有平台价值。但在 AI 行业,我们花了三年时间才意识到这个朴素的事实。

接下来的 AI 工程化竞争,赢家不会是"最强模型"的拥有者——而是最完善 Harness 的构建者。

当模型能力持续商品化、模型供应商被监管、顶级模型随时可能被下架时,真正支撑企业 AI 落地的,不是那个随时会变的"尖顶"——而是那个稳健的、可控的、可迁移的"地基"。

模型是锋芒,平台是根基。锋芒会钝,但根基决定了你能站多远。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐