Coding Agent 进入“垃圾时间”:AI 巨头为什么开始争夺 RSI?

摘要

AI Coding 仍在高速发展,但产品形态正在快速同质化。与此同时,田渊栋参与创办 Recursive,一批从 Google 离职的顶级研究者成立 Discovery Loop,Google DeepMind、OpenAI、Anthropic 生态也开始关注自动化研究、自我改进和验证闭环。本文从一个长周期 Codex 项目出发,分析 Coding Agent 为什么最先跑通、RSI 与普通 Agent Loop 有何区别,以及下一阶段真正稀缺的为什么不是生成能力,而是验证、记忆与能力沉淀。

关键词: Coding Agent、RSI、递归自我改进、Agent Loop、Eval、AI Lab

请添加图片描述

1. 一个连续运行十几个小时的 Coding Agent 项目

我曾经让 Codex 连续运行十几个小时,开发一个多 Agent 讨论系统。

我的原始需求并不复杂:让多个 Agent 在同一个聊天室中围绕需求展开讨论,相互审核方案,处理分歧,最终形成一个经过交叉评审的结论。

Codex 最终确实完成了一个可以启动的 Web 系统。页面能打开,不同模型也能接收任务。从“能不能把一句需求变成软件”这个角度看,结果已经相当惊人。

但真正使用之后,问题很快暴露出来:

  • 两个 Agent 的工作过程基本割裂;
  • 缺少稳定的共享状态与长期记忆;
  • 所谓相互审核,更接近把一段输出转发给另一个模型;
  • 交互方式与我真正需要的工作流存在偏差;
  • 页面能够运行,但仍有不少 Bug 和体验问题;
  • 系统没有明确区分“功能已经实现”和“需求真正得到满足”。

这个项目让我看到了一条非常清晰的边界:

只要目标、系统边界和验收标准足够清晰,Coding Agent 已经可以长时间执行复杂任务;但它还不能自动替人定义什么才是正确的问题和真正完成的结果。

换句话说,代码生成正在变得便宜,问题定义、结果验证和经验沉淀仍然昂贵。

2. 为什么 Coding Agent 最先跑通?

Coding Agent 率先成熟,并不是偶然。

软件开发天然拥有一个机器可以直接参与的反馈闭环:

未通过

通过

理解目标

生成或修改代码

编译、运行、部署

测试、类型检查、日志

定位错误并修复

完成当前任务

这个闭环具有几个重要特点:

  1. 执行环境数字化:代码、终端、依赖和测试都可以被 Agent 直接操作。
  2. 反馈速度快:很多错误在几秒或几分钟内就能返回。
  3. 验证成本相对低:编译是否通过、测试是否成功,通常有明确结果。
  4. 实验可以复制:相同代码和环境可以重复运行,便于重试和比较。
  5. 失败可以局部修复:Agent 能根据日志修改代码,再进入下一轮。

因此,Coding 不只是一个适合大模型应用的垂直场景,它还是 AI 第一次真正进入“提出方案、执行方案、观察反馈、持续修正”的完整数字实验室。

3. “垃圾时间”并不是说 Coding Agent 没用了

这里所说的“垃圾时间”,是一种赛道判断,不是说 Coding Agent 已经停止进步。

Codex、Claude Code、Cursor 等产品还会继续提升模型能力、上下文长度、终端控制、代码审查、并行执行和远程任务能力。Coding Agent 也会成为越来越多开发者的基础工具。

问题在于,它们的核心产品形态正在快速收敛:

  • 读取代码库;
  • 修改文件;
  • 运行测试;
  • 根据错误继续修复;
  • 调用外部工具;
  • 提交代码或生成 Pull Request;
  • 在高风险操作前请求人工确认。

当所有产品都沿着类似的能力列表竞争时,继续多写一点代码、再快一点生成页面,仍然有商业价值,却越来越难定义 AI 的下一个阶段。

Coding Agent 的下一个故事,不是一次多写多少代码,而是每次执行能否让下一轮系统变得更强。

4. 普通 Agent Loop 与 RSI 的区别

RSI 是 Recursive Self-Improvement 的缩写,通常翻译为“递归自我改进”。

普通 Coding Agent Loop 的目标,是使用当前系统完成当前任务。失败之后,它修改代码、重新运行,直到测试通过或者达到停止条件。

RSI 进一步追问:这次执行产生的经验,能否反过来改善执行下一次任务的系统?

对比维度 普通 Coding Agent Loop RSI / 递归改进循环
主要目标 完成当前任务 同时增强下一轮系统
主要反馈 测试、日志、编译结果 Eval、实验结果、人工反馈、长期指标
修改对象 当前项目代码 策略、Prompt、Skill、工具、记忆、验证器,必要时包括模型训练
经验保存 提交代码或修复 Bug 提取可复用能力并进入后续循环
主要风险 当前任务失败 错误经验被持续放大

这里需要特别澄清:递归自我改进不等于模型每完成一次任务就重写自己的权重。

从工程实现看,更现实的第一阶段通常发生在模型外部:

  • 更新任务策略和系统提示词;
  • 把人工纠正沉淀成可复用 Skill;
  • 为高频问题增加新的工具;
  • 改进记忆检索和上下文组织;
  • 建立更可靠的测试集与验证器;
  • 调整路由、权限、重试和停止条件;
  • 收集高质量轨迹,再用于后续训练或微调。

因此,早期 RSI 更像是一个可持续改进的 Agent Runtime 与 Harness,而不是一个脱离环境、独自无限升级的模型。

请添加图片描述

普通迭代解决当前任务,递归改进还要改变下一轮系统。

5. 一个可落地的 RSI 系统需要哪些组件?

如果把 RSI 暂时放下科幻色彩,一个可执行的递归改进系统至少需要五层能力。

5.1 任务与执行层

系统需要接收明确目标、约束条件和验收标准,并调用模型、代码执行环境、搜索、模拟器或领域工具完成任务。

5.2 反馈与验证层

系统必须判断结果是否真的更好。反馈可能来自单元测试、基准评测、仿真实验、真实业务指标、领域专家或人工审批。

5.3 轨迹与记忆层

只保存聊天记录远远不够。系统还要记录任务状态、决策理由、工具调用、失败原因、验证结果以及哪些经验已经得到确认。

5.4 能力更新层

系统需要把有效经验转化为下一轮可复用的变化,例如更新 Skill、工具描述、工作流、检索规则、评测数据集或训练样本。

5.5 安全与人工边界

并不是所有系统变化都应该自动生效。高风险工具、权限扩张、验证器修改、训练数据写入和线上部署,都需要明确的审批与回滚机制。

一个更接近现实的工程流程如下:

当前结果不合格

结果有效

需要审批

通过

低风险自动更新

拒绝

目标、约束与验收标准

Agent 执行任务

工具、代码、实验环境

Eval 与验证器

修复当前任务

提取可复用经验

是否允许更新系统能力

Human Approval

更新 Skill、工具、记忆或策略

保留记录,不进入能力库

这张图中最重要的节点不是“Agent 执行”,而是 EvalHuman Approval。没有可靠验证和控制边界,所谓自我改进很容易变成错误的自动积累。

6. 为什么顶级研究者开始成立新的 AI Lab?

近期最值得关注的信号,不只是大公司发布了哪些新功能,而是顶级研究者正在重新选择问题。

田渊栋参与创办的 Recursive Superintelligence,直接把递归自我改进和自动化 AI 研究写进了公司的目标。

Jeff Dean、Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 离开 Google,共同创办 Discovery Loop。它关注的是自动化科学与工程中的实验循环:提出假设、设计实验、调用工具或模拟器、分析结果、验证结论,再调整下一轮实验。

Discovery LoopRSI 并不是同一个概念:

  • Discovery Loop 首先关注如何让 AI 持续改进科学与工程成果;
  • RSI 更进一步,关注系统能否改进产生这些成果的方法乃至系统本身。

但两条路线共享一个重要判断:下一代高价值 AI 系统不会只回答一次问题,而要长期进入真实反馈,积累经过验证的发现,并让本轮工作成为下一轮的起点。

这也解释了为什么新的 AI Lab 值得关注。成熟大厂仍然拥有算力、模型、数据和产品渠道,新团队则可以围绕一个更激进的问题重新组织人才、系统与实验方法。

7. Google DeepMind、OpenAI、Anthropic 都在做 RSI 吗?

严格来说,不能把所有相关工作都直接叫作 RSI。不同团队的目标、方法和公开表述并不相同。

但它们的研究方向正在出现明显交集:

团队或生态 公开方向 与 RSI 的关系
Google DeepMind Co-Scientist、多 Agent 科学假设生成与验证 探索自动化研究循环,强调验证瓶颈
OpenAI Codex 与 Agentic AI 在科学计算中的应用 把 Coding Agent 推向研究工具和实验执行层
Anthropic 生态 将人工纠正沉淀为 Skill,构建可积累经验的 Agent 探索模型外部的持续能力更新
Recursive 自动化 AI 研究与递归自我改进 直接以 RSI 为核心目标
Discovery Loop 自动化科学与工程发现循环 让 AI 长期进入实验与知识发现过程

所以,更准确的说法不是“所有公司都正式转向 RSI”,而是:

大模型行业的竞争重心,正在从一次性生成能力,转向长期运行、自动验证、经验积累与系统改进。

8. 真正的瓶颈:生成越来越便宜,验证仍然昂贵

Coding Loop 能快速运行,是因为测试相对便宜。把同样的循环复制到科研、芯片设计、药物发现或复杂工程中,难度会显著上升。

代码测试通常几秒或几分钟就能返回结果,但一次生物实验、材料实验或药物验证可能需要数周。代码是否编译通过相对明确,一个科学假设是否成立,则需要数据、实验、同行评议和领域专家共同判断。

模型可以快速生成一百个假设。如果验证能力没有同步增长,我们得到的可能不是一百项突破,而是一百项等待人类检查的新负担。

请添加图片描述

生成正在变得廉价,验证却正在成为稀缺资源。

RSI 系统必须回答几个困难问题:

  1. 什么结果值得保留?
  2. 谁来证明它确实优于旧方案?
  3. 错误经验怎样避免进入记忆和训练数据?
  4. 验证器本身是否可能被系统“钻空子”?
  5. 系统什么时候可以自动更新,什么时候必须交给人?
  6. 新能力导致回归时,能否定位原因并回滚?

没有可靠验证的自我改进,很可能只是错误在系统里递归放大。

9. 对开发者意味着什么?

如果这条趋势成立,开发者需要关注的就不只是“哪个模型写代码更强”。

下一阶段更重要的工程资产可能包括:

  • 任务规范:把模糊需求变成可执行目标、约束和验收标准;
  • Eval:建立覆盖功能、质量、安全和长期效果的验证体系;
  • Trace:保存完整执行轨迹,能够解释失败发生在哪里;
  • Memory:沉淀经过确认的事实、决策和经验,而不是无限追加聊天记录;
  • Skill 与工具系统:把高频解决方案封装成可调用能力;
  • Human Approval:对权限、发布、能力更新和高风险结果进行把关;
  • 版本与回滚:知道每次系统变化改了什么,是否真的带来提升。

对于 Agent 产品来说,模型能力只是起点。真正决定系统能否长期工作的,是模型外部的 Harness、反馈闭环和验证基础设施。

10. 结语:Coding 的终点,可能是 RSI 的起点

Coding Agent 进入“垃圾时间”,并不意味着 Coding 不重要。恰恰相反,Coding 正在从一个独立产品能力,变成下一代 Agent 操作数字世界的通用语言。

未来的科研 Agent、芯片 Agent、模型研究 Agent,都需要生成程序、调用工具、运行实验、分析日志和修复失败。Coding Agent 过去一年跑通的闭环,很可能是自动化研究与递归改进的基础设施预演。

真正的竞争将不再只比较谁一次生成的代码更漂亮,而会比较:

  • 谁能让 Agent 长期运行而不偏离目标;
  • 谁拥有更真实的实验环境和更可靠的验证器;
  • 谁能把失败、人工反馈和领域知识沉淀为可复用能力;
  • 谁能让今天完成的任务,真正改善明天的系统。

Coding Agent 已经证明 AI 可以完成工作。RSI 想证明的,是 AI 能不能改进“完成工作的方法”本身。

AI Coding 的赛道已经非常拥挤,而围绕自动化研究、验证闭环和递归改进成立的新 AI Lab,正在打开下一张牌桌。


参考资料

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐