大家好,我是浩哥,本周周报四(4),解读技术深究·模型vs工程之争的深度分析文章,文章内容来自最新的公众号内容,有感兴趣可以点点关注、持续分析该系列文章,本系列文章主要作用还是降低你收集文章和自己解读文章时间,内容也是让AI深度结合文章观点进行整理。
一个 Agent 系统跑得好,到底是因为模型强,还是外面那套包装厉害?这是 2026 年 AI 工程界最吵不赢的争论。

方向:技术深究·模型vs工程之争 | 日期:2026-07-28 | 覆盖:周报第四期·AIEngineer编程


一、一个信号:同一个问题,两派人吵了半年仍在吵

2026 年 3 月,Latent Space 的 swyx 提出了一个金融圈的老问题:一个交易员赚了三百万美元,多少是她自己的本事,多少是因为她就坐在那个位子上?换个人上去,结果会不会也差不多?

现在 AI 工程里也在问同样的问题:一个 Agent 系统跑得好,到底是因为模型强,还是外面那套包装厉害?

这是 Big Model 和 Big Harness 两派的争论核心。AIEngineer编程在《Big Model VS Big Harness》中完整呈现了这场争论的双方论点。这场争论不是 Twitter 上的随口一说——Latent Space 专门写了文章,AIE Europe 还给了 Harness Engineering 专场。

Big Model 派说:秘方在模型里,外面的包装越薄越好,模型每强一点,原来要靠工程手段补的那块就被模型直接吞掉了。

Big Harness 派说:模型就那样了,你能动手优化的就是外面的工程系统。你买不到更聪明的模型,但你可以让系统跑得更稳。

两派都拿得出数据和案例。两派都说得通。那问题出在哪?


二、Big Model 派的论据

Big Model 派的代表人物是 Claude Code 的负责人 Boris Cherny。他在播客里反复讲一件事:Claude Code 的秘诀全在模型里,harness 尽量做薄,而且还在越做越薄。每三四周重写一次,一次比一次简单。

背后的想法是:模型每强一点,原来靠工程手段补的那块就被模型直接吞掉了,对应的 harness 代码就可以删掉。

Noam Brown 从历史角度补了一刀。他说推理模型出来之前,大家费老大劲搭 agentic 系统,说白了就是用多次调用普通模型来模仿推理。现在推理模型来了,那些复杂的脚手架不光是没用,有时候反而碍事——直接把问题扔给推理模型,不加包装,它自己就能搞定。他猜现在堆在推理模型上的那些 scaffold,早晚也是这个命。

Chain-of-Thought 就是个现成的例子。这招以前是重要的 prompt 工程技巧,现在推理模型自己就会了,你不用再写「让我们一步一步思考」。Tree-of-Thought、Self-Consistency 这些更复杂的采样策略,也在走同样的路。

数据上也有支撑。Scale AI 的 SWE-Atlas 评测显示,同一个模型在不同 harness 里的表现差异基本在误差范围内——也就是说,harness 带来的增益很有限。METR 的独立评测也差不多是这个结论。


三、Big Harness 派的论据

Jerry Liu(LlamaIndex 创始人)说得最直接:模型之外的一切就是一切。想把 AI 用起来,最大的瓶颈是你自己做上下文工程和工作流工程的能力。

注意他没说 harness 比模型更重要,而是说:模型就那样了,你能动手优化、能控制的部分就是 harness。

Vercel 有个反直觉的发现:把 Agent 的工具数量砍掉 80%,整体效果反而更好。工具越多,模型每步要做的选择就越复杂,单步出错的可能就越大,多步下来错误攒得越多。精简工具集不是限制模型,是帮它少走岔路。

Manus 的例子更极端:六个月里,底层模型没换,harness 框架重写了五次,每次重写可靠性都明显涨。这说明 harness 有自己的工程深度,不是随便包一层就完事,也不会因为模型变强就自动变好。

blog.can.ac 有一篇文章标题就很直接:《一个下午改进 15 个 LLM 的编码能力——只改了 Harness》。模型不变,优化 harness 之后,15 个不同的 LLM 在编码任务上都涨了一大截。这是 Big Harness 派最核心的论据:换模型是 Y 轴,优化 harness 是 X 轴,两个方向都能走,都值得投钱。

AIEngineer编程在文章中提到,数据仓库领域的实践也印证了这个观点——通过搭建七层 Harness 工程框架,单需求人工耗时从约 14 小时降至约 47 分钟,提效 94%,生产级宽表交付零副作用达成率达 96%。这不是模型换来的,是工程系统换来的。


四、为什么吵不出结果

AIEngineer编程的分析非常诚实:两边说的都没错,但他们看的是不同时间点。

Big Model 派看的是一个动态过程:模型一直在变强,今天要工程手段补的,明天可能就被模型学会了。这个方向没错。

Big Harness 派看的是当下的工程现实:就现在这些模型,系统层的质量直接决定落地好不好使。这也是真的。

分歧在于「当下」有多长。如果每六个月模型就跳一大截,那 harness 上砸的功夫可能很快就废了。但就算这样,模型强了之后,人马上会把它扔到更难的任务上,新的 harness 需求又冒出来。这事不会有终点。

另一个角度是任务类型。Big Model 派的证据主要是编码任务——这类事成功失败很清楚,模型强了就是好用。但很多企业里的 Agent 场景,麻烦不在推理,而在外面那些乱七八糟的系统:第三方 API 返回格式变来变去,私有数据库的文档不全,业务流程里一堆潜规则。这些问题模型再强也解决不了,只能靠 harness 收拾。

还有一个被很多人忽视的角度——谁的屁股坐在哪张椅子上。swyx 原文里说:「Big Harness 的人在卖 Harness,Big Model 的人在卖 Model。」听他们说话的时候,想想他们在卖什么。


五、干活的人怎么办:裸奔测试

站队没什么意思。对做工程的人来说,更实在的问题是:我现在这个项目,瓶颈到底在哪?

最简便的试法是裸奔测试:不加 harness,直接把任务扔给模型,看结果。

裸奔能到 70% 以上,说明模型本身够用。接下来该搞的是可靠性和可观测性,不是瞎折腾编排。

裸奔结果很差,先分清楚是哪类问题:

  • 模型听不懂任务 → 换模型或改 prompt
  • 缺信息 → 上下文工程
  • 得用工具 → 工具设计

每加一层 harness,都问一句:这层解决的问题,为什么模型自己搞不定?

  • 答案是「得调外面的系统」→ 加,这是 harness 该干的
  • 答案是「模型老忘上下文」→ 先试试优化 prompt 结构和压缩上下文
  • 答案是「我们要控制模型行为」→ 有时候一条好使的 system prompt 比加层代理管用

六、总结:三个实操判断

第一,不要把信仰当工程决策。 Big Model 还是 Big Harness 不是立场问题,是项目阶段和任务类型的问题。编码任务可能更靠近 Big Model 一侧,企业集成场景可能更靠近 Big Harness 一侧。

第二,harness 的复杂度本身就是成本。 更难调,更难修,模型版本一换每一层都得重新测。Manus 重写五次的代价不只是工程时间,还有每次重写带来的行为不确定性。有个原则可以记一下:harness 的复杂度和任务的可靠性要求成正比。

第三,先埋日志再选方向。 不管站哪边,你得知道系统在哪跪的。在 harness 里埋够日志,比选什么架构都优先。没数据,Big Model 还是 Big Harness 吵来吵去都是信仰。


📋 文章来源清单

# 核心素材 公众号 链接
1 Big Model VS Big Harness AIEngineer编程 微信搜一搜「AIEngineer编程」
2 AIAgent安全:我们正在用错误的范式应对一场范式转移 AIEngineer编程 微信搜一搜「AIEngineer编程」
3 Agent开发这个词其实误导了很多人 AIEngineer编程 微信搜一搜「AIEngineer编程」
4 面试官皱眉:模型是地板harness才是天花板 小林面试笔记(AgentGuide) 微信搜一搜「AgentGuide」
5 当AICoding撞上数据仓库:用Harness工程升级为端到端流水线 DataFunTalk 微信原文

说明:AIEngineer编程和AgentGuide的文章为直接上传至知识库,log中无对应微信下载记录,可在微信搜一搜搜索对应公众号名查找原文。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐