Anthropic 疯了?Opus 5 性能直逼自家旗舰 Fable 5,价格却砍一半

57 天内更新四条产品线,Fable 5 发布仅 45 天就被 Opus 5 追平,GPT-5.6 Sol 被直接点名对标——Anthropic 这波操作,是在卷别人,还是在卷自己?

2026 年 5 月 28 日,Claude Opus 4.8 发布。12 天后,旗舰模型 Fable 5 和 Mythos 5 登场。6 月 30 日,Sonnet 5 上线。7 月 24 日,Opus 5 发布。

短短 57 天,Anthropic 几乎把 Claude 的几条主要产品线全部更新了一遍。即便放在模型按月迭代的 AI 行业里,这个速度也有些夸张。其中最让人意外的,是 Fable 5 和 Opus 5 之间只隔了 45 天——旗舰模型的王座还没坐热,就被自家中端产品线追了上来。

Anthropic 简直就是在高喊:“打败我自己的只能是我自己。”


一、Opus 5 到底是什么:用一半的钱,办旗舰的事

一句话定位:性能接近旗舰 Fable 5,价格只有一半。

Opus 5 延续了 Opus 4.8 的定价——输入 $5/百万 Token,输出 $25/百万 Token。但在多项编程和智能体测试中,它的完成率更高,单位任务成本反而下降。

最直接的对手是 OpenAI 的 GPT-5.6 Sol。两者输入价格相同,但 Opus 5 的输出价格低约 17%。处理超长资料时差距更大:Opus 5 对 100 万 Token 上下文维持普通单价,而 GPT-5.6 Sol 输入超过 27.2 万 Token 后,输入价格翻倍,输出价格提高 50%。

对于大型代码库、长篇研究资料和复杂智能体任务,这项差异会直接反映到账单上。

维度 Opus 5 Fable 5(旗舰) GPT-5.6 Sol
输入价格 $5/百万Token $10/百万Token $5/百万Token
输出价格 $25/百万Token $50/百万Token $30/百万Token
100万Token上下文 单价不变 单价不变 超27.2万Token后翻倍
CursorBench 最高分差距 基准 <0.5%领先
对齐表现 Claude 系列最佳

Opus 5 没有在所有项目中胜过 GPT-5.6 Sol,但在电脑操作、商业流程和陌生问题求解等需要模型连续做事的任务上,表现和价格都更有竞争力。
在这里插入图片描述


二、六项评测拆解:Opus 5 强在哪里

2.1 编程:Frontier-Bench 和 CursorBench

在 Frontier-Bench v0.1(软件工程评测)中,Opus 5 超过所有其他模型。与 Opus 4.8 相比,完成每项任务的成本更低,成绩却提高了一倍以上。

在 CursorBench 3.2(编程能力评测)中,当投入档位设为最高时,Opus 5 与 Fable 5 最高得分之间的差距不到 0.5%,每项任务的成本却只有 Fable 5 的一半。

在 high、xhigh 和 max 三个投入档位下,按相同成本比较,Opus 5 的表现也超过了所有其他模型。

这意味着什么? Opus 5 尤其擅长处理具有实际价值的软件工程任务。对于日常开发场景——代码生成、Bug 修复、重构、代码审查——它能在更低成本下产出更高质量的代码。

2.2 陌生问题求解:ARC-AGI 3

ARC-AGI 3 是"陌生题"测试,模型拿不到现成套路,只能自己摸索规则、判断目标并调整策略。

Opus 5 的得分达到第二名的 3 倍。

这个结果很能说明问题。3 倍的差距不是"略好",而是代际跨越。说明 Opus 5 遇到从未见过的问题时,更有能力靠试错找到解法——这正是智能体(Agent)场景最需要的能力。

2.3 商业流程自动化:AutomationBench

AutomationBench 要求模型调用商业软件,从头到尾完成一项任务。

Opus 5 的通过率约为第二名的 1.5 倍。即使使用最低投入档位,也超过其他模型的最高成绩。

翻译成大白话:Opus 5 不用付出最高的推理成本,也能完成更多任务。 这对于需要批量调用 LLM 的企业场景来说,直接意味着账单缩水。

2.4 电脑操作:OSWorld 2.0

OSWorld 2.0 测试模型操作电脑的能力——打开应用、查找信息、跨软件操作并持续推进任务。

Opus 5 只花费略高于 Fable 5 三分之一的成本,成绩就超过了 Fable 5 的最高水平。

这意味着 Opus 5 在电脑操作场景下的效率明显更高。 对于需要模型自动操作浏览器、文件系统、办公软件的 Agent 应用,这是目前性价比最高的选择。

2.5 知识工作:GDPval-AA 和 HLE

GDPval-AA v2 模拟真实知识工作,Opus 5 最高得分 1861,高于 Fable 5 的 1747 和 GPT-5.6 Sol 的 1736。大约花 700 美元,就能达到其他模型最高投入档位附近的成绩。

HLE 考察跨学科难题。不调用工具时,Opus 5 以 56.3% 略低于 Fable 5 的 56.5%;允许使用工具后,它升至 64.7%,反超 Fable 5 的 63.9%,成本也更低。

关键洞察:Opus 5 单靠模型内部知识未必总是第一,但一旦可以搜索、调用工具和反复核对,优势就会扩大。 这说明它的工具使用能力很强,适合构建需要调用外部 API、数据库、搜索引擎的复合 Agent。

2.6 科研:生命科学评测

Opus 5 在 Anthropic 全部生命科学评测中都超过 Opus 4.8。其中光谱推断分子结构和预测蛋白质变异影响两项任务分别提高 10.2 和 7.7 个百分点。

这些提升意味着 Opus 5 在辅助分子结构分析、蛋白质功能预测等科研环节上更有潜力。


三、三个案例:Opus 5 的"自主推进"能力有多强

Anthropic 用了三个案例说明 Opus 5 比此前模型更会独立推进任务。这些案例比评测分数更能体现模型的能力边界。

案例一:没有图纸工具?自己写一个

测试要求模型根据机械零件图纸,用代码重建一个 FreeCAD 三维模型。但系统没有提供直接查看图纸的工具。

Opus 5 的做法:自己写了一套计算机视觉程序,从原始像素中提取尺寸和几何结构,随后完成了建模。

其他模型:同样条件下连续尝试 5 次也没有成功。

这个案例的核心不是"Opus 5 会写 CV 代码",而是它能在工具缺失时自己补工具。传统模型遇到工具缺失会卡住或反复重试,Opus 5 会重新定义问题——从"如何查看图纸"变成"如何从像素提取尺寸"。

案例二:比社区修复更彻底

一个流行的开源软件包管理器存在 Bug。

Opus 5 的做法:查出了程序错误的根本原因,还补上了社区修复方案遗漏的边缘情况。

对比模型:只消除了表面症状,随后便宣布问题已经解决。

这展示的是 Opus 5 的"深度推理"能力——不停留在"让报错消失"的表层,而是追溯到根因。这对于自动化代码审查和 Bug 修复场景价值极大。

案例三:找不到数据?自己造验证工具

一家交易公司的工程师让 Opus 5 为新交易所搭建市场数据系统。

此前模型:即使拿到详细方案也无法完成。

Opus 5 的做法:找不到实时数据用于验证,便自行做了一套测试工具检查代码。

这个案例体现的是"目标导向"的行为模式——遇到障碍不报错退出,而是绕过障碍继续推进。这正是 Agent 和传统 Chatbot 的本质区别。


四、视觉生成:从代码到三维交互

Anthropic 用两个可交互的演示展示了 Opus 5 的视觉生成能力:

演示一:三维风洞

  • 用户能够旋转汽车、调整风速
  • 观察气流如何绕过车身
  • 同时查看阻力系数等数据

演示二:三维动物细胞模型

  • 用户可以转动、剖开细胞
  • 点击细胞核、粗面内质网等结构查看说明
  • 页面会主动指出示意图为了便于展示做了哪些简化

这两个案例的意义:Opus 5 已经能把代码、三维建模、交互界面和知识讲解整合进同一个成品里。用户给出一段要求后,它可以直接搭出接近教学软件或产品原型的演示。

这不是"生成一段代码",而是"生成一个可用的产品"。从代码生成到产品生成的跨越,正是 Opus 5 区别于上一代模型的关键。


五、安全与对齐:能力越强,约束越重要

模型开始自行补工具、检查结果、修正错误后,人类需要确认它不会为了完成目标隐瞒问题、绕过限制,或者做出风险过高的决定。

Anthropic 称 Opus 5 是目前对齐表现最好的 Claude 模型。

5.1 对齐审计结果

上线前的自动化审计显示,与 Opus 4.8、Sonnet 5 和 Fable 5 相比,Opus 5:

  • 更能遵守 Claude 宪法
  • 欺骗行为更少
  • 更难被诱导执行有害请求

5.2 网络安全:能找漏洞,不能造武器

Anthropic 没有专门用攻击任务训练 Opus 5,但模型综合能力提高后,它寻找代码漏洞的水平已经接近 Mythos 5。

两者在发现漏洞时表现相近,到了编写漏洞利用程序、把缺口转化成实际攻击手段的阶段,Opus 5 仍明显落后。

能力 Opus 5 Mythos 5
源代码审计和漏洞发现 ✅ 可用 ✅ 可用
二进制漏洞扫描 ❌ 被拦截 ✅ 可用
渗透测试 ❌ 被拦截 ✅ 可用
漏洞利用程序生成 ❌ 被拦截 ✅ 可用

相比 Fable 5,新分类器触发干预的频率预计减少约 85%,正常的安全研究更少被误伤。

触发限制后,Claude.ai、Claude Code 和 Claude Cowork 会默认改用 Opus 4.8 处理请求;加入网络安全验证计划的企业和研究人员,可以使用限制较少的版本。

5.3 生物学:最强科研模型,但有边界

Opus 5 成为 Anthropic 面向普通用户开放的最强科研模型,但在需要长时间独立运行的研究任务中仍有明显局限。

此前在 Fable 5 上因安全限制被拦截的生物学请求,现在会先转交给 Opus 5 处理。普通科研问题因此能用上更强的模型,高风险任务仍然留在安全边界之外。


六、行业竞争格局:Anthropic vs OpenAI 的贴身肉搏

Anthropic 这轮更新紧贴着 OpenAI 的节奏:

时间 Anthropic OpenAI
5月28日 Opus 4.8 发布
6月9日 Fable 5 + Mythos 5 发布
6月30日 Sonnet 5 发布
7月9日 GPT-5.6 发布,官方评测把 Fable 5 列为主要参照模型
7月24日 Opus 5 发布,官方将 GPT-5.6 Sol 放进核心对比

15 天前,OpenAI 在 GPT-5.6 发布时把 Fable 5 列为参照。15 天后,Anthropic 发布 Opus 5,把 GPT-5.6 Sol 放进核心对比,并在电脑操作、商业流程、陌生问题求解等项目中展示优势。

两家公司追着对方出牌的意图已经十分明显。

对于开发者和企业用户来说,这是好事——竞争直接转化为性价比提升。Opus 5 用一半的价格提供接近旗舰的能力,GPT-5.6 Sol 在长上下文场景的价格劣势也被放大。模型选择的决策逻辑正在从"哪个最强"变成"哪个性价比最高"。


七、对开发者的影响:该怎么选

7.1 选 Opus 5 的场景

  • 日常编程辅助:代码生成、Bug 修复、重构、代码审查——性价比最高
  • Agent 应用:需要模型连续操作电脑、调用工具、推进多步骤任务——OSWorld 和 AutomationBench 领先
  • 长上下文处理:大型代码库、长篇研究资料——100 万 Token 单价不变
  • 企业批量调用:单位任务成本下降直接反映到账单

7.2 仍需考虑其他模型的场景

  • 最高质量代码生成:如果不在乎成本,Fable 5 仍有微弱领先
  • 网络安全攻防:Mythos 5 在漏洞利用方面更强
  • 生物学深度研究:需要长时间独立运行的研究任务仍有局限

7.3 迁移建议

如果你已经在用 Opus 4.8:

  • 直接切换,价格不变,性能全面提升
  • API 调用方式不变,模型名改为 claude-opus-5

如果你在用 Fable 5:

  • 评估成本敏感度。如果 0.5% 的性能差距对你的业务不关键,切换到 Opus 5 可以省一半成本
  • 如果是安全研究场景,留在 Fable 5 或 Mythos 5

如果你在用 GPT-5.6 Sol:

  • 长上下文场景(超 27 万 Token)Opus 5 价格优势明显
  • 电脑操作和商业流程自动化场景 Opus 5 表现更好
  • 输出价格低 17%,高频调用场景成本差异可观

八、写在最后:模型迭代速度正在超越评估速度

57 天更新四条产品线,这个节奏带来一个现实问题:模型迭代速度正在超越社区评估速度。

一个新模型发布后,独立评测机构需要 2-4 周才能完成全面测试。但 Anthropic 的发布节奏是每 2-3 周一个新模型。这意味着当你刚完成对 Fable 5 的评估时,Opus 5 已经发布了。

对于开发者来说,这意味着:

  1. 不要执着于"等最终评测再决策"——评测永远滞后于发布
  2. 关注性价比而非绝对性能——头部模型的性能差距已经在 1% 以内,但价格差距可能在 2 倍以上
  3. 建立自己的 Benchmark——用自己业务的真实任务做评估,比通用评测更有参考价值

Opus 5 的发布传递了一个清晰的信号:AI 模型的竞争已经从"谁最强"进入"谁最具性价比"的阶段。 对于开发者和企业用户来说,这是真正利好——你不需要为旗舰价格买单,就能拿到接近旗舰的能力。


Opus 5 现已上线,成为 Claude Max 的默认型号和 Claude Pro 的最强型号。开发者可通过 API 调用,模型名 claude-opus-5

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐