摘要

从 Prompt 工程到 Harness 工程,AI Coding 方法论最大的进步是“把感觉变成数据”:每次改提示词、换模型、调工具,都通过一个可复现的评测闭环回答“是升是降”。本文用一套可直接复用的配置与代码,拆解 Harness 工程的三块基石——任务描述规范、验证信号设计、评测集维护,并分享从“拍脑袋调优”到“数据驱动”的转型案例。

关键词:Harness 工程、Coding Agent、评测闭环、Prompt 工程、Agent 评测、验证信号、代码评测、AI 原生研发、智能体测试、奇点智能大会

一、没有评测闭环,一切调优都是玄学

这是绝大多数 AI Coding 团队的现状:提示词改了一版,Agent 好像变聪明了,又好像没有;模型升级了,线上表现忽好忽坏,说不出为什么。本质原因是缺少“评测闭环”——没有一个可复现的流程,能对 Agent 的能力做客观、定量的评估。没有评测,调优就只能靠“感觉”,而感觉在 Agent 这种高方差系统面前极不可靠。

我们观察过一个团队:三个月里他们改了 20 多版提示词,每次都是“我试了感觉好多了”,但拿真实任务一跑,只有 6 版真的有提升,其余 14 版纯属自我感觉良好。搭起评测闭环后,这类“无效调优”被直接消灭——改完先跑评测,数据说话,不过就回滚。评测闭环不是“锦上添花的工具”,而是 AI Coding 工程化的地基。

二、任务描述规范:把需求写成 Agent 能执行的样子

Harness 的第一个组成部分是“任务描述规范”——Agent 的输入。写得越清晰,Agent 表现越稳定。我们的经验是要包含五要素:目标(要达成什么状态)、范围(改哪些文件、不碰哪些文件)、约束(性能要求、兼容性要求、编码规范)、验证方式(怎么判断完成:单测?构建?)、交付物(产出什么格式)。

Plain Text

# 任务描述模板(可直接复制使用)
任务目标: 将订单模块的查询接口从同步改为带超时的异步
范围: 仅 orders/ 目录下 3 个文件;禁止改动数据库 schema
约束:
  - 保持对外接口签名不变
  - 超时时间 2s,超时返回错误码 504
  - 遵循仓库现有错误处理规范
验证方式:
  - 新增单测通过: orders/tests/test_async_query.py
  - 全量构建通过: make build
交付物: 代码 diff + 变更说明

一个实测:同样的任务,用“五要素”写清描述后,Agent 的一次通过率从 34% 升到 62%,返工次数减半。任务描述不是“写清楚需求”,而是“写清楚验收标准”——验收标准是 Agent 不敢偷懒的底线。描述里写“做个查询接口”和写“超时 2s、错误码 504、不动 schema”,是两个完全不同的 Agent。

三、验证信号设计:让 Agent 每一步都有反馈

Harness 的第二个组成部分是“验证信号”——Agent 执行过程中的反馈。前文讲过一个核心规律:Agent 做得好不好,与反馈密度正相关。验证信号设计的目标,就是把任务从“不可验证的开放问题”变成“每一步都可验证的闭环”。三个层级:编译与静态检查(最廉价的信号,写错就报错)、单元测试与契约测试(行为级信号,逻辑错就暴露)、集成验证与性能基线(系统级信号,回归和退化就报警)。

工程要点是“信号要快”:Agent 是迭代式的,反馈越慢,迭代越慢。我们把 CI 的编译反馈压到 3 分钟以内后,Agent 的修复轮次明显变短,端到端任务完成时间缩短了 40%。另一个要点是“信号要准”:验证脚本自身的 flaky(不稳定)会误导 Agent——如果一个测试 10% 概率随机失败,Agent 会陷入“修一个不存在的错”的循环。验证信号的质量,直接决定 Agent 的收敛质量。

四、评测集维护:让 Agent 的能力可追踪

Harness 的第三个组成部分是“评测集”——一组固定的、代表真实业务分布的任务,每次 Agent 升级都跑一遍,看分数是升是降。评测集不是一次性建设,而是持续维护的资产:每次线上发现 Agent 的新失败模式,就把该任务沉淀进评测集;每次新功能上线,就把新类型任务补充进评测集。

维护评测集有三条纪律。第一,“只加不删”的基准集:核心任务一旦入选就不删,保证历史可对比(真的不合适的可以移到扩展集,但基准集要稳);第二,防过拟合:评测集任务要定期从真实 backlog 里刷新,避免 Agent 记住评测题;第三,分层报告:评测结果按“任务类型”分桶报告(bug 修复、单测生成、重构、新功能),不要只看总分——总分涨了可能是简单任务涨了,难题可能还在退步。

五、从“拍脑袋调优”到“数据驱动”的转型案例

把 Harness 落到团队里的过程,本质是一次工作方式的转型。某团队转型前:Agent 配置在个人手里,每个人自己的提示词、自己的工具组合,结果五花八门,无法对比;转型后:统一 Harness(统一任务模板、统一验证、统一评测集),所有 Agent 变更走“先评测、后上线”的流程。效果数据:Agent 一次通过率提升 28 个百分点,提示词“回滚率”(改了又改回去的比例)从 40% 降到 8%。

转型的关键不是工具,是“流程纪律”:评测不过不准上线、每次改动必须留评测记录、评测集由团队共同维护而不是个人私有。有了纪律,Harness 才能从“一个工具”变成“一套制度”。

六、给团队的启动路线:两周搭起最小 Harness

别把 Harness 想得太重,最小闭环两周内能搭起来。第一周:选定 20-30 个代表性任务,写成五要素格式的任务描述,配上最简单的验证(编译 + 单测),跑通“任务—Agent—验证—打分”的最小循环;第二周:补评测报告(按任务类型分桶),把流程固化到日常——任何 Agent 配置变更必须跑评测。第三周开始进入持续优化:按评测数据调提示词、补验证信号、扩展评测集。

两周后你得到的不是“完美的 Harness”,而是一个“能回答’改没改好’的系统”——这已经比 90% 的团队领先了。从 Prompt 工程到 Harness 工程,再到 Loop 工程,方法论演进的主线始终是“把模糊变清晰、把感觉变数据”。想系统学习 Harness 工程与评测闭环的完整方法论,11 月 20-21 日奇点智能技术大会《AI 原生软件研发:从 Harness 到 Loop》专题,将有构建过成熟 Agent 评测体系的一线专家现场拆解全套实践。


📌 点击大会海报,免费领取大会 PPT 资料

奇点智能大会 2026 将于 2026 年 11 月 20-21 日在北京万达文华酒店举办,由奇点智能研究院与 CSDN 联合主办。旗下奇点智能技术大会(SITS)与 C++及系统软件技术大会(CPP-Summit)双会并行:第一天上午 Keynote 主会场四场主题演讲与圆桌论坛,两天六大分会场覆盖 18 个前沿技术主题,70+ 位技术专家、1000+ 行业精英同场交流。

点击上方大会海报,扫码即可免费领取大会全套 PPT 资料,抢先解锁 70+ 专家的完整议题与干货内容。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐