Coding Agent 进入“垃圾时间”:AI 巨头为什么开始争夺 RSI?
Coding Agent 进入“垃圾时间”:AI 巨头为什么开始争夺 RSI?
摘要
AI Coding 仍在高速发展,但产品形态正在快速同质化。与此同时,田渊栋参与创办 Recursive,一批从 Google 离职的顶级研究者成立 Discovery Loop,Google DeepMind、OpenAI、Anthropic 生态也开始关注自动化研究、自我改进和验证闭环。本文从一个长周期 Codex 项目出发,分析 Coding Agent 为什么最先跑通、RSI 与普通 Agent Loop 有何区别,以及下一阶段真正稀缺的为什么不是生成能力,而是验证、记忆与能力沉淀。
关键词: Coding Agent、RSI、递归自我改进、Agent Loop、Eval、AI Lab

1. 一个连续运行十几个小时的 Coding Agent 项目
我曾经让 Codex 连续运行十几个小时,开发一个多 Agent 讨论系统。
我的原始需求并不复杂:让多个 Agent 在同一个聊天室中围绕需求展开讨论,相互审核方案,处理分歧,最终形成一个经过交叉评审的结论。
Codex 最终确实完成了一个可以启动的 Web 系统。页面能打开,不同模型也能接收任务。从“能不能把一句需求变成软件”这个角度看,结果已经相当惊人。
但真正使用之后,问题很快暴露出来:
- 两个 Agent 的工作过程基本割裂;
- 缺少稳定的共享状态与长期记忆;
- 所谓相互审核,更接近把一段输出转发给另一个模型;
- 交互方式与我真正需要的工作流存在偏差;
- 页面能够运行,但仍有不少 Bug 和体验问题;
- 系统没有明确区分“功能已经实现”和“需求真正得到满足”。
这个项目让我看到了一条非常清晰的边界:
只要目标、系统边界和验收标准足够清晰,Coding Agent 已经可以长时间执行复杂任务;但它还不能自动替人定义什么才是正确的问题和真正完成的结果。
换句话说,代码生成正在变得便宜,问题定义、结果验证和经验沉淀仍然昂贵。
2. 为什么 Coding Agent 最先跑通?
Coding Agent 率先成熟,并不是偶然。
软件开发天然拥有一个机器可以直接参与的反馈闭环:
这个闭环具有几个重要特点:
- 执行环境数字化:代码、终端、依赖和测试都可以被 Agent 直接操作。
- 反馈速度快:很多错误在几秒或几分钟内就能返回。
- 验证成本相对低:编译是否通过、测试是否成功,通常有明确结果。
- 实验可以复制:相同代码和环境可以重复运行,便于重试和比较。
- 失败可以局部修复:Agent 能根据日志修改代码,再进入下一轮。
因此,Coding 不只是一个适合大模型应用的垂直场景,它还是 AI 第一次真正进入“提出方案、执行方案、观察反馈、持续修正”的完整数字实验室。
3. “垃圾时间”并不是说 Coding Agent 没用了
这里所说的“垃圾时间”,是一种赛道判断,不是说 Coding Agent 已经停止进步。
Codex、Claude Code、Cursor 等产品还会继续提升模型能力、上下文长度、终端控制、代码审查、并行执行和远程任务能力。Coding Agent 也会成为越来越多开发者的基础工具。
问题在于,它们的核心产品形态正在快速收敛:
- 读取代码库;
- 修改文件;
- 运行测试;
- 根据错误继续修复;
- 调用外部工具;
- 提交代码或生成 Pull Request;
- 在高风险操作前请求人工确认。
当所有产品都沿着类似的能力列表竞争时,继续多写一点代码、再快一点生成页面,仍然有商业价值,却越来越难定义 AI 的下一个阶段。
Coding Agent 的下一个故事,不是一次多写多少代码,而是每次执行能否让下一轮系统变得更强。
4. 普通 Agent Loop 与 RSI 的区别
RSI 是 Recursive Self-Improvement 的缩写,通常翻译为“递归自我改进”。
普通 Coding Agent Loop 的目标,是使用当前系统完成当前任务。失败之后,它修改代码、重新运行,直到测试通过或者达到停止条件。
RSI 进一步追问:这次执行产生的经验,能否反过来改善执行下一次任务的系统?
| 对比维度 | 普通 Coding Agent Loop | RSI / 递归改进循环 |
|---|---|---|
| 主要目标 | 完成当前任务 | 同时增强下一轮系统 |
| 主要反馈 | 测试、日志、编译结果 | Eval、实验结果、人工反馈、长期指标 |
| 修改对象 | 当前项目代码 | 策略、Prompt、Skill、工具、记忆、验证器,必要时包括模型训练 |
| 经验保存 | 提交代码或修复 Bug | 提取可复用能力并进入后续循环 |
| 主要风险 | 当前任务失败 | 错误经验被持续放大 |
这里需要特别澄清:递归自我改进不等于模型每完成一次任务就重写自己的权重。
从工程实现看,更现实的第一阶段通常发生在模型外部:
- 更新任务策略和系统提示词;
- 把人工纠正沉淀成可复用 Skill;
- 为高频问题增加新的工具;
- 改进记忆检索和上下文组织;
- 建立更可靠的测试集与验证器;
- 调整路由、权限、重试和停止条件;
- 收集高质量轨迹,再用于后续训练或微调。
因此,早期 RSI 更像是一个可持续改进的 Agent Runtime 与 Harness,而不是一个脱离环境、独自无限升级的模型。

普通迭代解决当前任务,递归改进还要改变下一轮系统。
5. 一个可落地的 RSI 系统需要哪些组件?
如果把 RSI 暂时放下科幻色彩,一个可执行的递归改进系统至少需要五层能力。
5.1 任务与执行层
系统需要接收明确目标、约束条件和验收标准,并调用模型、代码执行环境、搜索、模拟器或领域工具完成任务。
5.2 反馈与验证层
系统必须判断结果是否真的更好。反馈可能来自单元测试、基准评测、仿真实验、真实业务指标、领域专家或人工审批。
5.3 轨迹与记忆层
只保存聊天记录远远不够。系统还要记录任务状态、决策理由、工具调用、失败原因、验证结果以及哪些经验已经得到确认。
5.4 能力更新层
系统需要把有效经验转化为下一轮可复用的变化,例如更新 Skill、工具描述、工作流、检索规则、评测数据集或训练样本。
5.5 安全与人工边界
并不是所有系统变化都应该自动生效。高风险工具、权限扩张、验证器修改、训练数据写入和线上部署,都需要明确的审批与回滚机制。
一个更接近现实的工程流程如下:
这张图中最重要的节点不是“Agent 执行”,而是 Eval 和 Human Approval。没有可靠验证和控制边界,所谓自我改进很容易变成错误的自动积累。
6. 为什么顶级研究者开始成立新的 AI Lab?
近期最值得关注的信号,不只是大公司发布了哪些新功能,而是顶级研究者正在重新选择问题。
田渊栋参与创办的 Recursive Superintelligence,直接把递归自我改进和自动化 AI 研究写进了公司的目标。
Jeff Dean、Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 离开 Google,共同创办 Discovery Loop。它关注的是自动化科学与工程中的实验循环:提出假设、设计实验、调用工具或模拟器、分析结果、验证结论,再调整下一轮实验。
Discovery Loop 与 RSI 并不是同一个概念:
- Discovery Loop 首先关注如何让 AI 持续改进科学与工程成果;
- RSI 更进一步,关注系统能否改进产生这些成果的方法乃至系统本身。
但两条路线共享一个重要判断:下一代高价值 AI 系统不会只回答一次问题,而要长期进入真实反馈,积累经过验证的发现,并让本轮工作成为下一轮的起点。
这也解释了为什么新的 AI Lab 值得关注。成熟大厂仍然拥有算力、模型、数据和产品渠道,新团队则可以围绕一个更激进的问题重新组织人才、系统与实验方法。
7. Google DeepMind、OpenAI、Anthropic 都在做 RSI 吗?
严格来说,不能把所有相关工作都直接叫作 RSI。不同团队的目标、方法和公开表述并不相同。
但它们的研究方向正在出现明显交集:
| 团队或生态 | 公开方向 | 与 RSI 的关系 |
|---|---|---|
| Google DeepMind | Co-Scientist、多 Agent 科学假设生成与验证 | 探索自动化研究循环,强调验证瓶颈 |
| OpenAI | Codex 与 Agentic AI 在科学计算中的应用 | 把 Coding Agent 推向研究工具和实验执行层 |
| Anthropic 生态 | 将人工纠正沉淀为 Skill,构建可积累经验的 Agent | 探索模型外部的持续能力更新 |
| Recursive | 自动化 AI 研究与递归自我改进 | 直接以 RSI 为核心目标 |
| Discovery Loop | 自动化科学与工程发现循环 | 让 AI 长期进入实验与知识发现过程 |
所以,更准确的说法不是“所有公司都正式转向 RSI”,而是:
大模型行业的竞争重心,正在从一次性生成能力,转向长期运行、自动验证、经验积累与系统改进。
8. 真正的瓶颈:生成越来越便宜,验证仍然昂贵
Coding Loop 能快速运行,是因为测试相对便宜。把同样的循环复制到科研、芯片设计、药物发现或复杂工程中,难度会显著上升。
代码测试通常几秒或几分钟就能返回结果,但一次生物实验、材料实验或药物验证可能需要数周。代码是否编译通过相对明确,一个科学假设是否成立,则需要数据、实验、同行评议和领域专家共同判断。
模型可以快速生成一百个假设。如果验证能力没有同步增长,我们得到的可能不是一百项突破,而是一百项等待人类检查的新负担。

生成正在变得廉价,验证却正在成为稀缺资源。
RSI 系统必须回答几个困难问题:
- 什么结果值得保留?
- 谁来证明它确实优于旧方案?
- 错误经验怎样避免进入记忆和训练数据?
- 验证器本身是否可能被系统“钻空子”?
- 系统什么时候可以自动更新,什么时候必须交给人?
- 新能力导致回归时,能否定位原因并回滚?
没有可靠验证的自我改进,很可能只是错误在系统里递归放大。
9. 对开发者意味着什么?
如果这条趋势成立,开发者需要关注的就不只是“哪个模型写代码更强”。
下一阶段更重要的工程资产可能包括:
- 任务规范:把模糊需求变成可执行目标、约束和验收标准;
- Eval:建立覆盖功能、质量、安全和长期效果的验证体系;
- Trace:保存完整执行轨迹,能够解释失败发生在哪里;
- Memory:沉淀经过确认的事实、决策和经验,而不是无限追加聊天记录;
- Skill 与工具系统:把高频解决方案封装成可调用能力;
- Human Approval:对权限、发布、能力更新和高风险结果进行把关;
- 版本与回滚:知道每次系统变化改了什么,是否真的带来提升。
对于 Agent 产品来说,模型能力只是起点。真正决定系统能否长期工作的,是模型外部的 Harness、反馈闭环和验证基础设施。
10. 结语:Coding 的终点,可能是 RSI 的起点
Coding Agent 进入“垃圾时间”,并不意味着 Coding 不重要。恰恰相反,Coding 正在从一个独立产品能力,变成下一代 Agent 操作数字世界的通用语言。
未来的科研 Agent、芯片 Agent、模型研究 Agent,都需要生成程序、调用工具、运行实验、分析日志和修复失败。Coding Agent 过去一年跑通的闭环,很可能是自动化研究与递归改进的基础设施预演。
真正的竞争将不再只比较谁一次生成的代码更漂亮,而会比较:
- 谁能让 Agent 长期运行而不偏离目标;
- 谁拥有更真实的实验环境和更可靠的验证器;
- 谁能把失败、人工反馈和领域知识沉淀为可复用能力;
- 谁能让今天完成的任务,真正改善明天的系统。
Coding Agent 已经证明 AI 可以完成工作。RSI 想证明的,是 AI 能不能改进“完成工作的方法”本身。
AI Coding 的赛道已经非常拥挤,而围绕自动化研究、验证闭环和递归改进成立的新 AI Lab,正在打开下一张牌桌。
参考资料
- Recursive Superintelligence:Recursive self-improving superintelligence
- Recursive:First Steps Toward Automated AI Research
- Google DeepMind:Co-Scientist, a multi-agent AI partner
- Google DeepMind:AI agents and the new validation bottleneck in science
- OpenAI:Scientific computing in the age of agentic AI
- Anthropic:How Warp builds self-improving agents on Claude
- Axios:Google DeepMind leadership change and Discovery Loop
更多推荐




所有评论(0)