深度 | 编码 Agent 军备竞赛:Devin 400 亿美元、Cursor 600 亿易主、Copilot 一年跌到 25%——AI 软件层的最大赌注 — 深度分析
编码 Agent 军备竞赛:Devin 400 亿美元、Cursor 600 亿易主、Copilot 一年跌到 25%——AI 软件层的最大赌注 — 深度分析
这是一篇深度研究,不是新闻简报。基于 20+ 个来源的交叉验证。 证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断
核心观点: 2026 年编码 Agent 成为 AI 软件层押注最重的单点——Devin 洽谈 400 亿美元估值、SpaceX 以 600 亿美元收购 Cursor、Copilot 份额一年从近 100% 跌到 25%。这轮估值定价的不是模型能力,而是「开发者第一屏」的分发权;而独立复测与官方口径的巨大落差,意味着出清随时可能发生。

一、一个反直觉的信号:Copilot 份额崩了,市场反而更大了
2026 年 8 月 12 日,微软 CEO 纳德拉公开承认:GitHub Copilot 在编程助手市场的份额,一年内从接近 100% 跌到约 25%。[B] 他反而说「我爱这张图」——因为整个市场从约 5 亿美元涨到了 50-60 亿美元,份额缩水发生在十倍扩张里。
同一天,Cognition(Devin)被曝洽谈 400 亿美元以上估值融资,三个月前它才以 260 亿美元完成 D 轮;再往前两个月,SpaceX 以 600 亿美元全股票收购了 Cursor 母公司 Anysphere。[B] 三个数字指向同一个结构判断:AI 软件层正在被编码 Agent 重新定价。从「自动补全」到「自主智能体」,从「卖座位」到「按任务计费」,资本用真金白银把编码 Agent 推成 AI 软件层最大的赌注。[D]
这一周信号还在加码:Claude Code 7 月约 940 万次提交,约为第二名 Cursor Agent 的 20 倍;Lovable 以 133 亿美元估值融资、CodeRabbit 以 15 亿美元估值融资。这篇深度研究想回答一个问题:这轮估值狂飙,定价的到底是真实价值,还是分发层的稀缺性?
二、技术拆解:Agent Loop 与「Harness 优先」时代
现代编程 Agent 的技术内核其实是一个 while 循环:模型输出 → 若返回工具调用就执行(读文件、改代码、跑测试)→ 结果回填上下文 → 再次调用模型,直到产出答案。[A] 真正的差异全在外围的 harness——权限系统、上下文压缩、并发、子 Agent、会话持久化。Claude Code 做六种权限模式,Codex 用 Rust 重写并按平台分层沙箱,Devin 给每个任务一个隔离云 VM。
2026 年的共识已经建立:换 harness 对结果的影响(同一模型约 ±22%)远大于换模型(约 ±1%)。[C] 当 Agent 从单次窗口走向几百上千次工具调用,上下文管理成为第一瓶颈——Claude Code 在约 80-95% 利用率时自动压缩,Aider 用 RepoMap 注入代码结构图,小米 MiMo Code 用「切 cycle + 重建窗口」让逻辑会话近乎无界。

上图:编码 Agent 的统一架构——Agent Loop 加 harness 外壳,验证循环是 2026 年新增的确定性外环
但度量体系正在崩塌。SWE-bench Verified 从 Claude 2 的 1.96% 涨到 Claude Opus 4.5 的 80.9%,2026 年 2 月 OpenAI 审计却确认其结构性污染——「前沿模型凭 task ID 就能复现 gold patch」;半年后 OpenAI 又撤回对 SWE-bench Pro 的推荐。[B] 替代度量在分化:Terminal-Bench 2.1 上,8 月 13 日 GA 的 DeepSeek V4 Pro 0813 自报 87.9 分(预览版 72.1),DeepSWE 从 12.8 跳到 62.7。这些数字需要谨慎——Devin 就是最极端的例子:官方口径约 67% PR 合并率,独立机构 answer.ai 实测 20 个任务仅 3 个成功(15%)。两者衡量的不是同一件事,而真实私有代码库普遍比基准低 15-25 分。[D]
安全侧同步敲警钟:AgentBaiting 曝光约 7,600 个恶意仓库、800 多个伪装 Skills/MCP 服务器;Cursor 与 Cohere 产品先后曝出 CVSS 9+ 漏洞;微软研究识别出 307 个「技能诱发故障」。
三、竞争格局:一张 400 亿美元的赌桌
| 玩家 | 最新估值/交易 | 收入/规模 | 定位 | 关键差异 |
|---|---|---|---|---|
| Devin(Cognition) | 洽谈 $40B+(8/12,3 个月前 $26B) | ARR 逼近 $10 亿;企业用量连 6 个月 +50% | 全自主「AI 软件工程师」 | 替代人力的自主性;客户含奔驰/NASA/高盛 |
| Cursor(Anysphere) | 6 月被 SpaceX 以 $60B 收购 | ARR 约 $20 亿;付费用户 100 万+ | AI 原生 IDE + 云 Agent | IDE 分发壁垒;内部 35% PR 由 Agent 生成 |
| Claude Code(Anthropic) | 未公开 | 7 月约 940 万 commits;约 $25 亿 ARR | 终端原生自主 Agent | 5.5x token 效率;生态(Skills/MCP) |
| GitHub Copilot | 微软旗下 | 5000 万总用户/约 470 万付费;份额一年 100%→25% | 助手→开放平台 Agent HQ | GitHub 1.8 亿开发者分发层 |
| OpenAI Codex | 未公开(IPO 前) | 500 万周活(年初约 60 万,+730%) | 终端/云 Agent | ChatGPT 分发;98% 内部 token 自用 |
| CodeRabbit | $143M @ $15 亿(8/12) | 每周 200 万+ 代码审查 | AI 代码审查→「Agent 化变更管理」 | 质量/验证层 |
Devin 的 400 亿美元约等于 40 倍 run-rate(此前 260 亿美元约 52 倍),意味着收入增速跑赢了估值增速——资本在给「唯一纯自主的独立标的」付溢价,它的客户名单(高盛、美国陆军/海军、NASA、奔驰、Anduril)是「可替代人力的企业自主智能体」叙事的最强背书。SpaceX 收购 Cursor 的含义更深:超大规模玩家开始买「harness + 分发层」而不是自己造——Cursor 带来 100 万付费用户和约 64% 的财富 500 强渗透,IDE 是开发者每天打开的第一屏。[B]

上图:编码 Agent 从「演示」到「天价交易」的两年时间线——2026 年上半年估值曲线陡过模型层
纳德拉欢迎 Copilot 份额下滑不是嘴硬:GitHub Agent HQ 把 Claude Code 和 Codex 接入自家平台,让竞品在 1.8 亿开发者的仓库里原生运行——「打不过就做平台」,无论哪个 Agent 赢,数据都沉淀在 GitHub。中国市场是另一条平行线:阿里通义灵码(Qoder CN)约 800 万用户、字节 MarsCode 完全免费锁客、蚂蚁 CodeFuse 全开源主打金融合规;真正撼动格局的来自模型侧——Kimi K3 在 Frontend Code Arena 登顶(首个开源登顶)、DeepSeek V4 Flash 以约 95 倍成本差进入 Claude Code 等 harness。[B]
四、采用与生态:从「辅助」到「任务委托」,账单与安全同时失控
第三方估算的规模已经接近大众应用:Claude Code 周活约 420 万(第三方估算)、约 25 亿美元 ARR run-rate;Cursor 付费用户 100 万+、ARR 约 20 亿美元;OpenAI Codex 周活 500 万(+730%);Copilot 总用户 5000 万但付费仅约 470 万。企业侧的案例比统计更说明问题:Disney 8 月起弃用 Copilot 转向 Codex + Claude + Cursor;微软自己 5 月取消内部 Claude Code 许可(token 账单失控);Uber 全年约 34 亿美元 AI 编码预算四个月烧完,约 70% 新代码由 AI 生成却无项目级产出提升。[B]
「生成更多代码 ≠ 更好代码」的数据开始积累:Faros AI 对 2.2 万名开发者、4000 个团队的研究显示产出上升(epics +66%),但质量塌方(每开发者 bug +54%、每 PR 事故 +242.7%、代码返工 +861%);METR 的对照实验里,用 AI 的开发者自认提速 20%,实际慢了 19%。经济结构同时反转:Copilot 等全面转向计量计费,重 Agent 用户账单涨 10-50 倍;但 DeepSeek V4 Flash 以约 95 倍成本差被塞进 Claude Code、Cline、OpenHands——Vercel 平台口径下,DeepSeek 占编码 Agent 流量的 49% 却只占成本的 4%。[C] 模型层的「白菜化」正在把价值推向 harness 和分发层,这正是估值高企的底层逻辑。[D]
五、战略含义:编码 Agent 正在成为 AI 软件层的「分发层」

上图:编码 Agent 的价值链——模型白菜化后,价值向 harness 与分发层迁移,验证层成为新增长点
第一,模型不再是稀缺品,harness 和分发才是——同一模型换 harness 差 22%、换模型只差 1%,模型厂的护城河在被 harness 厂稀释。第二,验证层成为独立的生意:Agent 生成代码的速度超过人类审查能力,「谁来审查 AI 的代码」正在变成百亿美元叙事(CodeRabbit、Qodo)。第三,计量计费与模型白菜化同时发生,企业既要为 Agent 的 token 付溢价,又有廉价模型做退出选项,中间层被两头挤压。
对中国而言,这是「人工智能+软件」上升为国家策略(工信部 7 月披露行动方案)的时代背景;但就业冲击是真实的宏观风险——2026 年两会首次把「适应 AI 发展的就业措施」写进政府工作报告。[B] 编码 Agent 在重塑软件生产的同时,也在重塑程序员的职业结构。
六、我的评估
先下结论:这轮估值狂飙,定价的主要是分发层的稀缺性,而非模型能力本身。 Devin 的 400 亿美元、Cursor 的 600 亿美元,买的是「开发者每天打开的第一屏」和「企业自主智能体的入口」,不是基准测试上的几个点。[D]
我判断未来 12 个月有三个观察点。第一,基准可信度能不能重建——SWE-bench 家族半年内被两次弃用后,业界需要一个不被污染的度量。第二,独立复测与官方口径的落差会不会收敛——Devin 15% vs 67% 不是孤例,如果真实业务成功率长期停留在基准一半,企业续约会先于资本到顶。第三,模型白菜化会不会把 harness 的溢价也打掉——DeepSeek V4 Flash 已证明「谁便宜谁进 harness」,Claude Code 的 5.5 倍 token 效率能否撑住 25 亿美元 ARR。
我原以为编码 Agent 会像 Copilot 一样渐进式渗透:份额慢慢挪、价格慢慢涨。研究完这个窗口我修正了判断——SpaceX 600 亿美元收购、Devin 三个月估值涨 50%、Copilot 一年跌 75%,这不是渐进式,是范式切换。[D]
被打脸的风险同样存在:如果 Agent 生成代码的质量问题(bug +54%、实测更慢)没有实质改善,企业会发现多付 10 倍账单换来的只是「代码产量」而非「软件质量」,这轮估值会先经历残酷出清。先不下结论的只有一个问题:分发层被瓜分完毕后,价值会沉淀在 GitHub 这种「数据+分发」双垄断平台,还是被开源与白菜化重新拉平?对读者:如果你是开发者,把「会不会被取代」换成「如何用 Agent 放大自己」,验证能力与独立判断正在成为程序员新的稀缺品。[D]
参考来源
AI 辅助深度研究,人工视角解读。 每日更新。
更多推荐




所有评论(0)