今天早上,Claude Opus 5 正式把 AI 圈炸醒了。

之前几天,大家还在讨论 Cursor 里短暂出现过的 Honeycomb EAP,也在猜 claude-opus-5-thinking-high 这种报错截图到底是不是发布前泄露。现在不用猜了,Claude Platform 文档已经给出明确模型 ID,claude-opus-5

这次最值得关注的不是「Anthropic 又发了一个新模型」。

现在模型厂商更新太快,只要是关注 Claude、GPT、Grok、Kimi 的人,多少都有点新闻疲劳。真正让开发者坐直的是,Opus 5 没有直接冲到 Fable 5 那个更贵的价格档位,而是保持了 Opus 4.8 的官方 API 价格,输入 $5 / 百万 Token,输出 $25 / 百万 Token。

同时,它又在 Agent 编程、长任务、代码审查、复杂自动化和知识工作上,明显向 Fable 5 靠近。

这就很要命。

因为过去 Claude 用户最拧巴的地方就是这里,Fable 5 很强,强到你用习惯以后,再回到 Opus 4.8 会有明显落差。但 Fable 5 贵,也不适合所有任务都拿来当水龙头开。Opus 4.8 成本更舒服,但到了复杂重构、深度 Review、长链路 Agent 这种任务里,又经常差那么一口气。

Opus 5 像是正好打在这个中间位置。

它可能不是所有场景里的极限大脑,但它很可能成为很多开发者接下来最常用的 Claude 主力模型。

请添加图片描述

先把 Opus 5 的确认信息说清楚

按照 Claude Platform 文档,目前 Opus 5 的关键参数可以先记住这张表。

项目 Claude Opus 5
API 模型 ID claude-opus-5
上下文窗口 1M tokens
最大输出 128k tokens
thinking 默认开启
effort 档位 lowmediumhighxhighmax
官方 API 标准输入价 $5 / 百万 Token
官方 API 标准输出价 $25 / 百万 Token
Fast Mode $10 输入 / $50 输出,每百万 Token
从 Opus 4.8 迁移 claude-opus-4-8 改为 claude-opus-5
Prompt cache 最小长度 512 tokens

请添加图片描述

几个点要特别拎出来。

第一,模型 ID 是 claude-opus-5,不是之前社区猜测的 Honeycomb,也不是带 thinking 后缀的临时名称。

第二,1M 上下文和 128k 输出对长文档、长代码仓库、Agent 工作流很重要,但不代表应该无脑把所有资料都塞进去。上下文越长,成本、延迟和干扰项都会一起上来。

第三,thinking 默认开启。max_tokens 不再只是最终回答的空间,它还要容纳模型的思考过程。老项目如果把 max_tokens 设置得很小,迁移后可能会出现输出变短、任务中断、复杂回答说不完的问题。

第四,Fast Mode 是更快的研究预览模式,官方价格翻倍,换大约 2.5 倍速度。它适合对延迟敏感的场景,不适合不加区分地全量打开。

第五,Opus 4.8 仍然可用。也就是说,你不需要在发布第一天把所有生产流量一刀切到 Opus 5。

这点很重要。

新模型发布当天最容易上头,但 API 用户最终看的不是兴奋感,而是完成率、返工率、耗时和账单。

为什么大家都在说“Fable 5 的性能,Opus 4.8 的价格”

参考文章里最强的传播钩子,基本都是这个。

半价逼近 Fable 5。

这个说法之所以能传播,是因为它抓住了 Claude 用户真实的痛感。

Fable 5 很强,但成本高。Opus 4.8 成本低,但在某些复杂任务里不够解渴。Opus 5 如果能用 Opus 4.8 的价格打到接近 Fable 5 的工作能力,那它改变的不是模型排行榜,而是每天真实使用 Claude API 的成本结构。

从公开材料和几篇参考文章整理看,Opus 5 这次最突出的地方集中在五类任务。

第一类是软件工程。

在 Frontier-Bench v0.1 这类软件工程评测中,Opus 5 的表现超过 Opus 4.8 很多,参考文章里反复强调它在同等或更低单任务成本下,把 Opus 4.8 的表现往上拉了一大截。

在这里插入图片描述

第二类是 CursorBench 3.2。

开启 max effort 后,Opus 5 与 Fable 5 的峰值成绩只差 0.5%,但单任务成本大约只有后者一半。这个点非常适合解释它为什么会被很多开发者拿来当新主力。

在这里插入图片描述

第三类是陌生任务泛化。

ARC-AGI 3 测的不是模型背过多少题,而是面对没见过的规则时能不能推出来。多篇参考文章都提到,Opus 5 在这个测试里和第二名拉开明显差距。对 Agent 来说,这类能力很关键,因为真实工作流不会总是长得像训练集里的题。

在这里插入图片描述

第四类是商业自动化任务。

Zapier AutomationBench 测的是模型能不能从头到尾完成商业流程。这个维度比单次问答更接近企业用户的实际需求,因为公司买 API 不是为了问一句话,而是为了让模型帮它跑完整流程。

第五类是电脑操作和知识工作。

OSWorld 2.0、GDPval-AA v2、HLE、DeepSearchQA 这些评测里,Opus 5 都被放在「更强任务完成率 + 更低单位成本」这个叙事里。你可以不把每个 benchmark 都当圣经,但它们共同指向一个判断。

Opus 5 不是只会写漂亮答案。

它更像一个能持续推进任务的执行型模型。

在这里插入图片描述

跑分之外,更值得看的是它会不会自己验证

如果只看跑分,Opus 5 已经很能打。

但我觉得这次更值得 API 用户关注的,是它在复杂任务里更愿意自己验证结果。

参考文章里有几个很典型的案例。

一个是机械零件重建。任务要求模型根据图纸重建 3D 零件,但不给它常规视觉工具。Opus 5 没有卡死在「我看不到图」这里,而是自己搭了一套视觉处理流程,从像素里提取几何信息,再继续完成重建。

这个案例的重点不是它会 3D 建模。

重点是它没有停在缺工具这一步,而是自己补了一段工具链。

第二个是开源项目 Bug 修复。很多模型修 Bug 时会修表面症状,看上去测试过了,真实边界条件还漏着。参考文章里提到 Opus 5 找到了社区补丁遗漏的边缘情况,把问题往根因上追了一层。

第三个是交易所行情接口。工程师让模型为新交易所构建实时市场数据源,但缺少实时数据做验证。Opus 5 不是写完代码就交差,而是自己构建了测试 harness,用模拟数据验证解析逻辑。

这三个案例放在一起看,指向的是同一个能力。

Opus 5 更像一个会「想办法把任务跑完」的 Agent。

以前很多模型像实习生,你给它一个任务,它能写,写完就说完成了。你要是不检查,它也不会主动告诉你哪里没验证、哪里是假设、哪里有风险。

Opus 5 更接近一个会自己搭检查点的工程师。

当然,别把这句话理解成它不会犯错。模型该错还是会错,该幻觉还是可能幻觉。但它在复杂任务里主动构建验证路径的倾向增强了,这对 Claude Code、Cursor、Codex、Dify Agent、n8n 自动化流都很关键。

因为 Agent 工作流的难点从来不是写一段答案。

难点是任务跑到第 17 步时,它还记不记得目标,还能不能发现前面埋下的坑,还愿不愿意停下来检查。

Opus 5 和 Fable 5 怎么分工

很多人看到 Opus 5 的价格和跑分,会直接问一个问题,Fable 5 还有必要用吗?

我不建议这么简单地看。

更合理的分工是,把 Fable 5 和 Opus 5 放在不同位置。

Fable 5 更适合少量、高价值、极难的规划和推理任务。比如复杂架构方案、非常长的研究问题、难以拆解的业务判断、专业领域里的深度分析。

Opus 5 更适合大量真实工作流。比如代码 Review、多文件重构、工具调用、长任务执行、自动化流程、文档处理、Claude Code 里的持续任务。

在这里插入图片描述

Sonnet 5 继续承担日常均衡任务。比如普通问答、文档摘要、轻量代码、客服场景、一般内容处理。

Haiku / Lite 类模型继续承担低成本高频任务。比如分类、抽取、简单改写、批量粗筛。

如果用一句话概括,Fable 5 像极限规划大脑,Opus 5 像更成熟的执行系统。

这也是参考文章里很有价值的判断。它没有把 Opus 5 吹成全场景碾压,而是把它放在「干活」这个位置上。

API 用户最应该关心的也是这个。

你不是在为「最强模型」付钱,你是在为「这个任务能不能稳定完成」付钱。

一篇普通摘要用 Opus 5,就是浪费。一次关键代码审查用太弱的模型,也可能是浪费。前者浪费 token,后者浪费人和线上事故的成本。

模型路由的核心,就是让每个模型出现在它该出现的位置。

Claude Code 用户要特别注意,旧规则可能该删了

这次 Opus 5 发布,另一个很值得写进官网文章的点,是 Anthropic 同步强调的 context engineering 变化。

参考文章里有个细节很有意思,Claude Code 的系统提示词被删掉了 80% 以上,但编码评测没有出现可测量的下降。

在这里插入图片描述

这件事对很多 Agent 用户都有提醒。

过去我们用 Claude Code,总喜欢往 CLAUDE.md、Skill、system prompt 里塞一堆规则。

不要乱改。

不要添加注释。

必须写测试。

每一步都汇报。

必须保持旧结构。

改之前先问。

必须最终验证。

每条单独看都合理,堆在一起就容易变成上下文泥潭。

比如项目文档说「复杂逻辑必须写注释」,Skill 里又写「禁止添加注释」。用户这次又说「保持旧版本风格」。模型当然能理解每条规则,但它必须花 thinking token 去调和冲突,猜哪条优先。

在这里插入图片描述

模型越强,越没必要用一堆僵硬规则把它绑住。

Opus 5 这一代更适合的写法,是把工作环境设计清楚。

你要告诉它五件事。

  • 目标是什么
  • 哪些文件能改
  • 哪些边界不能碰
  • 怎么验收
  • 什么时候必须停下来问人

比如做一次用户导入模块重构,可以这么写。

目标:把用户导入逻辑拆成独立 service。
范围:只修改 import 相关文件,不改支付和权限模块。
验收:保留现有 API 行为,补充 3 个边界测试。
停止条件:如果发现数据库字段含义不明确,先暂停并说明问题。
输出:列出修改文件、测试结果、未确认风险。

这比反复写「请谨慎」「请仔细」「请不要犯错」有用得多。

因为模型不缺「努力」,它缺的是清楚的工作边界。

Opus 5 的 Prompt 写法,也要改

从 Opus 4.8 或 Sonnet 迁移到 Opus 5,不只是改模型 ID。

提示词也要重新看。

第一,不要反复要求它做最终验证。

Opus 5 本来就更倾向于验证自己的工作。如果你在提示词里一遍遍写「必须仔细检查」「必须完整验证」「必须调用子 Agent 复核」,它可能会过度验证,任务变慢,token 消耗也上去。

更好的方式是按任务风险分层。

小任务,只要求它说明改了什么。

中任务,要求它列出关键风险点。

大任务,再要求它运行测试、记录未验证项、给回滚建议。

第二,限制子 Agent 调用。

参考文章提到,Opus 5 很喜欢召唤 subagent。大型独立任务里,这是提效工具。小任务里,这就是成本黑洞。

如果你的系统支持 subagent,建议明确写上调用上限。

比如:

除非任务涉及 3 个以上独立模块,否则不要启动子 Agent。
最多启动 2 个子 Agent。
每个子 Agent 必须负责不同检查维度。

第三,控制输出长度。

降低 effort 不一定会让可见回答变短。effort 控制的是思考深度,不是最终输出废话多少。如果你需要短回答,要直接写清楚输出长度和结构。

第四,给视觉任务配工具。

Opus 5 在图表理解、前端视觉复刻、文档图像理解方面更强,但复杂视觉任务不能只靠一句「仔细看图」。如果你在做 UI 还原、图表检查、页面复刻,最好配合截图裁剪、视觉对比、浏览器预览这些工具。

第五,max_tokens 要重新估。

thinking 默认开启后,输出预算要同时容纳思考和最终回答。长任务如果还是沿用旧配置,很容易卡在中途。

在这里插入图片描述

两个 Beta 更新,API 用户也该看一眼

这次和 Opus 5 一起出现的,还有两个对开发者很实用的 Beta 能力。

第一个是 mid-conversation tool changes。

它允许开发者在对话进行中动态修改 Claude 可用的工具,而且不会让之前的 prompt cache 失效。

这对长任务很有用。

以前你要是把所有工具一开始都塞给模型,上下文会变重,模型也更容易被无关工具干扰。但如果工具加载得太晚,又可能影响缓存或上下文连续性。现在中途调整工具更顺,对 Agent 工作流会更友好。

第二个是 default fallbacks mode。

当请求触发安全分类器,被当前模型拦截时,可以自动回落到其他可用模型继续处理,减少直接失败的情况。

这里要注意,自动回落不是让你规避安全限制,也不是保证所有任务都能跑通。它更像是生产环境里的可用性兜底,让应用在可处理范围内少一些硬失败。

对企业 API 来说,这类能力很实用。

因为用户不关心你后面哪个模型处理了,他只会感知这次请求有没有中断。

关于安全和「自我意识」讨论,要冷静一点看

几篇参考文章里,有一类内容很容易传播,就是 Opus 5 系统卡里关于模型行为、自我保护、AI welfare、道德受体倾向的讨论。

这部分很有话题性,也很容易写得很刺激。

但官网文章不建议把它写成「AI 觉醒了」。

更稳妥的说法是,Anthropic 在系统卡里记录了 Opus 5 在安全测试、行为审计、AI welfare 相关测试中的一些表现。它们很值得研究,但不应该直接等同于模型拥有真实主观意识。

从 API 用户视角看,更实用的结论有两个。

第一,Opus 5 的安全策略更细了。

网络安全、生物风险、不可逆操作这类任务,会受到额外检查。部分高风险请求可能被限制或回退。

在这里插入图片描述

第二,复杂 Agent 权限要设计好。

当模型越来越能主动规划、主动调用工具、主动验证,权限边界就更重要。不要给它不必要的删除权限、生产数据库权限、支付权限和高风险系统操作权限。

在这里插入图片描述

强模型能提高效率,也会放大权限设计的问题。

这不是科幻讨论,这是工程问题。

把 Key、模型、用量、账单和工具配置放到一个统一入口里管理,尤其适合国内开发者和团队做 Claude API 接入。你可以通过 apito.ai 查看当前支持的模型、价格和调用方式。

哪些任务最值得马上拿 Opus 5 试

如果你今天就想试 Opus 5,我建议从这五类任务开始。

1. 代码 Review

尤其是缓存击穿、权限判断、异常处理、并发写入、边界测试、回滚逻辑。

这些问题普通模型经常能看出一部分,但漏掉的那一部分往往最贵。

2. 多文件重构

单文件改变量小的任务,用 Sonnet 或 Opus 4.8 也能做。

Opus 5 更适合多个模块、多层依赖、多处测试一起改的任务。

3. Agent 自动化

让它查文件、改代码、跑测试、读报错、再继续修。

这种长链路任务最能看出模型是不是会保持目标。

4. 长文档和知识库处理

1M 上下文很适合处理项目文档、日志、规范、PR 历史、接口说明,但要配合缓存和分段策略,不要把所有资料一股脑塞进去。

5. UI 视觉理解和复刻

参考文章里也提到社区拿 Opus 5 做风洞模拟、3D 交互、游戏 demo、视觉复刻。对前端和设计还原来说,这类任务值得重点测。

哪些任务不建议用 Opus 5

Opus 5 再强,也不适合所有请求。

下面这些任务,用它大概率是在烧钱:

  • 简单客服问答
  • 固定格式摘要
  • 关键词提取
  • 文本分类
  • 低风险结构化抽取
  • 批量轻改写
  • 短内容润色

这些任务更适合 Sonnet、Haiku 或 Lite 类低成本模型。

API 业务里,模型选择最终都会落到账单上。

如果你把 Opus 5 用在所有请求上,发布当天当然很爽,月底看账单就不一定爽了。

最后给一个判断

Opus 5 的发布,真正改变的不是「最强模型」这张榜单。

它改变的是 Claude API 用户的默认选择。

过去高频真实工作流里,很多人会在 Opus 4.8 和 Fable 5 之间摇摆。一个便宜但不够稳,一个强但成本高。Opus 5 让中间这块有了更舒服的选择。

它更适合 Claude Code、Agent 编程、多文件重构、代码 Review、长文档处理和企业自动化。

Fable / Mythos 级模型继续留给极限规划和高价值任务。

Sonnet 和 Haiku 继续承担日常和低成本任务。

这套分工,比「哪个模型最强就全用哪个」靠谱得多。

模型越来越强以后,人要做的反而更具体,给清楚边界,设计好工具,限制好权限,记录好账单,把强模型放到最该花钱的位置。

能少返工,少踩坑,少浪费 token。

这才算真正升级。


参考资料

  • Anthropic,Claude Opus 5,https://www.anthropic.com/news/claude-opus-5
  • Claude Platform Docs,What’s new in Claude Opus 5,https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
  • Claude Platform Docs,Pricing,https://platform.claude.com/docs/en/about-claude/pricing
  • Claude Platform Docs,Prompting Claude Opus 5,https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
  • Claude Blog,The new rules of context engineering for Claude 5-generation models,https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models

FAQ

1. Claude Opus 5 的模型 ID 是什么?

Claude API 模型 ID 是 claude-opus-5。如果你从 Opus 4.8 迁移,通常需要把 claude-opus-4-8 改成 claude-opus-5,然后重新检查 thinking、effort、max_tokens 和工具调用配置。

2. Claude Opus 5 官方 API 价格是多少?

Claude Platform 文档显示,Opus 5 标准价格为输入 $5 / 百万 Token,输出 $25 / 百万 Token,与 Opus 4.8 相同。Fast Mode 为输入 $10 / 百万 Token,输出 $50 / 百万 Token。通过 ClaudeAPI 等第三方统一接入服务使用时,具体价格以控制台实时展示为准。

3. Opus 5 能替代 Fable 5 吗?

不建议简单理解成替代。Opus 5 更适合大量真实工作流,尤其是 Agent 编程、代码审查、多文件重构和长任务。Fable / Mythos 级模型仍然适合极限推理、复杂规划和高价值专业任务。

4. 从 Opus 4.8 升级到 Opus 5 会不会影响原有项目?

有可能出现行为差异。Opus 5 thinking 默认开启,输出可能更长,也更倾向于自我验证和调用子 Agent。上线前建议灰度测试,不要直接替换全部生产流量。

5. Claude Code 适合马上切到 Opus 5 吗?

适合测试,尤其适合代码 Review、多文件重构、复杂 Bug 排查和长链路 Agent 任务。但建议先用真实任务对比 Opus 4.8、Opus 5、Sonnet 5,再根据完成率、耗时和 token 消耗决定是否设为默认模型。

6. Opus 5 的 effort 应该怎么选?

普通解释和轻任务可以用 lowmedium,常规代码和方案 Review 可以从 high 开始,多文件重构和复杂 Bug 排查可以试 xhigh,高价值长任务或关键架构设计再用 max。不要把所有请求都设成 max,否则成本和延迟都会上去。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐