7 月 25 日凌晨,Anthropic 正式推出 Claude Opus 5。

这次发布有点不一样——Anthropic 没有像往常一样喊「最强模型」。官方给的定位很务实:Opus 5 在复杂任务上更少遗漏步骤、更倾向主动验证中间结果,兼顾性能与成本,适合日常高频使用。

定位的变化也直接体现在产品里。目前 Opus 5 是 Claude Max 的默认模型,也是个人订阅用户能调用的最强模型;能力更高的 Fable 5 主要面向 API 和企业客户,个人用户虽然可用,但额度相当有限。

问题来了:性能逼近、价格减半,Opus 5 能替代 Fable 5 吗?


·先看跑分:登顶了,但不是断层领先

截至 7 月 25 日,Artificial Analysis 智能指数榜单上,Opus 5 max 以 61 分排在第一位,比第二名的 Fable 5 高出 1 分。

但细看各项测试,Opus 5 并没有和其他模型拉开明显差距。它的优势更多体现在特定场景上:

·软件工程是最突出的方向。Frontier-Bench v0.1 测试中,Opus 5 超过所有参测模型,成绩比上一代 Opus 4.8 提高一倍以上,但单项任务成本反而更低。在 CursorBench 3.2 中,开启 max effort 后,Opus 5 和 Fable 5 的成绩差距不到 0.5%,但每项任务成本约为后者的一半。

类似优势也出现在需要模型连续操作的任务中。Zapier AutomationBench 测试里,按相同单项任务成本算,Opus 5 的通过率约为第二名 Fable 5 的 1.5 倍。在 OSWorld 2.0 测试中,它仅用了 Fable 5 约三分之一的任务成本,就超过了后者的最好成绩。

这些项目的共同点是:测试的不只是模型能不能答对一道题,还包括它能不能调用工具、跨越多个步骤、发现错误并继续推进。


·官方跑分需要谨慎看待

有几点值得注意。

第一,Anthropic 官方的 Frontier-Bench 测试结果,是在特定智能体框架下跑五次取平均值得来的。触发安全分类器时还会由 Opus 4.8 接管——这意味着工具配置、提示词和运行环境一变,结果也可能跟着变。

第二,Opus 5 并非在所有项目上都领先。在 Humanity's Last Exam 测试中,不开工具时 Opus 5 得 56.3%,略低于 Fable 5 的 56.5%;但开放工具后 Opus 5 升至 64.7%,反超 Fable 5 的 63.9%。

这个细节恰好说明了 Opus 5 和 Fable 5 的核心区别:Fable 5 的纯模型能力仍然更强,但 Opus 5 更擅长搜索、调用工具、检查结果并持续推进任务。

ARC-AGI 3 的成绩更能体现这一点。这道测试主要考察模型处理陌生规则和新问题的能力——不看训练数据有多少,看的是临场观察和试错能力。Opus 5 拿到了 30.2%,而此前这项测试的榜首 GPT-5.6 Sol 是 7.8%。当然,这个成绩取自 high 档而非 max 档,max 档的结果还没公布。


·三个实操亮点

除了跑分,Anthropic 披露的几个实操案例值得聊聊。

自己写视觉识别工具。 在没有图像查看工具的情况下,Opus 5 自行编写了一个计算机视觉程序,从机械图纸的原始像素中提取数据。这意味着模型不只是被动调用已有工具,而是在工具不全时主动「造工具」。

主动验证数据源。 另一个案例中,Opus 5 在缺少实时行情的情况下,自己搭建测试环境来验证交易所数据接口是否正确。这体现了两个能力——知道自己缺什么信息,以及有能力自己去找答案。

可交互产品原型。 有网友分享 Opus 5 生成的可交互 3D 黑洞可视化器,还能实时合成电子音乐。代码、视觉效果和声音被整合进同一个成品里,说明它在快速制作产品原型方面的能力相当强。

综合来看,Opus 5 这次升级的重点不是纯模型能力的跃升,而是执行、验证和纠错能力变得更成熟。说直白点,它不像「更聪明的学霸」,更像「更靠谱的同事」。


·价格和可用性

Opus 5 的 API 定价是每百万 token 输入 5 美元、输出 25 美元,和上一代 Opus 4.8 持平,约为 Fable 5 的一半。如果追求速度,可以开 Fast 模式,以约两倍价格换 2.5 倍速度。

Anthropic 同时上线了两项 Beta 功能:动态调整工具和自动回退。前者用于降低 Agent 任务因缓存失效导致的成本跳升,后者在安全拦截触发时自动降级处理,避免任务直接中断。这两个功能对企业级 Agent 应用来说很实在。

Opus 5 能替代 Fable 5 吗?

上线后用户的评价很快两极分化。正面评价集中在编程和可交互内容生成,负面评价主要是某些复杂推理任务上还是不如 Fable 5。

简单来说,Opus 5 是「性价比之选」——大部分任务体验接近 Fable 5,价格只有一半,很适合日常高频使用。但如果你的场景对纯推理能力的容错率极低(比如长篇法律文档的逐条分析),Fable 5 仍然是更稳妥的选择。

Anthropic 这次的产品定位非常清晰:Fable 5 打能力天花板,Opus 5 打性价比。不是在造一个「最强的模型」,而是在造一个「最值得每天用的模型」。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐