Claude Opus 5 正式发布:半价逼近 Fable 5,用户该怎么切换?
今天早上,Claude Opus 5 正式把 AI 圈炸醒了。
之前几天,大家还在讨论 Cursor 里短暂出现过的 Honeycomb EAP,也在猜 claude-opus-5-thinking-high 这种报错截图到底是不是发布前泄露。现在不用猜了,Claude Platform 文档已经给出明确模型 ID,claude-opus-5。
这次最值得关注的不是「Anthropic 又发了一个新模型」。
现在模型厂商更新太快,只要是关注 Claude、GPT、Grok、Kimi 的人,多少都有点新闻疲劳。真正让开发者坐直的是,Opus 5 没有直接冲到 Fable 5 那个更贵的价格档位,而是保持了 Opus 4.8 的官方 API 价格,输入 $5 / 百万 Token,输出 $25 / 百万 Token。
同时,它又在 Agent 编程、长任务、代码审查、复杂自动化和知识工作上,明显向 Fable 5 靠近。
这就很要命。
因为过去 Claude 用户最拧巴的地方就是这里,Fable 5 很强,强到你用习惯以后,再回到 Opus 4.8 会有明显落差。但 Fable 5 贵,也不适合所有任务都拿来当水龙头开。Opus 4.8 成本更舒服,但到了复杂重构、深度 Review、长链路 Agent 这种任务里,又经常差那么一口气。
Opus 5 像是正好打在这个中间位置。
它可能不是所有场景里的极限大脑,但它很可能成为很多开发者接下来最常用的 Claude 主力模型。

先把 Opus 5 的确认信息说清楚
按照 Claude Platform 文档,目前 Opus 5 的关键参数可以先记住这张表。
| 项目 | Claude Opus 5 |
|---|---|
| API 模型 ID | claude-opus-5 |
| 上下文窗口 | 1M tokens |
| 最大输出 | 128k tokens |
| thinking | 默认开启 |
| effort 档位 | low、medium、high、xhigh、max |
| 官方 API 标准输入价 | $5 / 百万 Token |
| 官方 API 标准输出价 | $25 / 百万 Token |
| Fast Mode | $10 输入 / $50 输出,每百万 Token |
| 从 Opus 4.8 迁移 | 将 claude-opus-4-8 改为 claude-opus-5 |
| Prompt cache 最小长度 | 512 tokens |

几个点要特别拎出来。
第一,模型 ID 是 claude-opus-5,不是之前社区猜测的 Honeycomb,也不是带 thinking 后缀的临时名称。
第二,1M 上下文和 128k 输出对长文档、长代码仓库、Agent 工作流很重要,但不代表应该无脑把所有资料都塞进去。上下文越长,成本、延迟和干扰项都会一起上来。
第三,thinking 默认开启。max_tokens 不再只是最终回答的空间,它还要容纳模型的思考过程。老项目如果把 max_tokens 设置得很小,迁移后可能会出现输出变短、任务中断、复杂回答说不完的问题。
第四,Fast Mode 是更快的研究预览模式,官方价格翻倍,换大约 2.5 倍速度。它适合对延迟敏感的场景,不适合不加区分地全量打开。
第五,Opus 4.8 仍然可用。也就是说,你不需要在发布第一天把所有生产流量一刀切到 Opus 5。
这点很重要。
新模型发布当天最容易上头,但 API 用户最终看的不是兴奋感,而是完成率、返工率、耗时和账单。
为什么大家都在说“Fable 5 的性能,Opus 4.8 的价格”
参考文章里最强的传播钩子,基本都是这个。
半价逼近 Fable 5。
这个说法之所以能传播,是因为它抓住了 Claude 用户真实的痛感。
Fable 5 很强,但成本高。Opus 4.8 成本低,但在某些复杂任务里不够解渴。Opus 5 如果能用 Opus 4.8 的价格打到接近 Fable 5 的工作能力,那它改变的不是模型排行榜,而是每天真实使用 Claude API 的成本结构。
从公开材料和几篇参考文章整理看,Opus 5 这次最突出的地方集中在五类任务。
第一类是软件工程。
在 Frontier-Bench v0.1 这类软件工程评测中,Opus 5 的表现超过 Opus 4.8 很多,参考文章里反复强调它在同等或更低单任务成本下,把 Opus 4.8 的表现往上拉了一大截。

第二类是 CursorBench 3.2。
开启 max effort 后,Opus 5 与 Fable 5 的峰值成绩只差 0.5%,但单任务成本大约只有后者一半。这个点非常适合解释它为什么会被很多开发者拿来当新主力。

第三类是陌生任务泛化。
ARC-AGI 3 测的不是模型背过多少题,而是面对没见过的规则时能不能推出来。多篇参考文章都提到,Opus 5 在这个测试里和第二名拉开明显差距。对 Agent 来说,这类能力很关键,因为真实工作流不会总是长得像训练集里的题。

第四类是商业自动化任务。
Zapier AutomationBench 测的是模型能不能从头到尾完成商业流程。这个维度比单次问答更接近企业用户的实际需求,因为公司买 API 不是为了问一句话,而是为了让模型帮它跑完整流程。
第五类是电脑操作和知识工作。
OSWorld 2.0、GDPval-AA v2、HLE、DeepSearchQA 这些评测里,Opus 5 都被放在「更强任务完成率 + 更低单位成本」这个叙事里。你可以不把每个 benchmark 都当圣经,但它们共同指向一个判断。
Opus 5 不是只会写漂亮答案。
它更像一个能持续推进任务的执行型模型。

跑分之外,更值得看的是它会不会自己验证
如果只看跑分,Opus 5 已经很能打。
但我觉得这次更值得 API 用户关注的,是它在复杂任务里更愿意自己验证结果。
参考文章里有几个很典型的案例。
一个是机械零件重建。任务要求模型根据图纸重建 3D 零件,但不给它常规视觉工具。Opus 5 没有卡死在「我看不到图」这里,而是自己搭了一套视觉处理流程,从像素里提取几何信息,再继续完成重建。
这个案例的重点不是它会 3D 建模。
重点是它没有停在缺工具这一步,而是自己补了一段工具链。
第二个是开源项目 Bug 修复。很多模型修 Bug 时会修表面症状,看上去测试过了,真实边界条件还漏着。参考文章里提到 Opus 5 找到了社区补丁遗漏的边缘情况,把问题往根因上追了一层。
第三个是交易所行情接口。工程师让模型为新交易所构建实时市场数据源,但缺少实时数据做验证。Opus 5 不是写完代码就交差,而是自己构建了测试 harness,用模拟数据验证解析逻辑。
这三个案例放在一起看,指向的是同一个能力。
Opus 5 更像一个会「想办法把任务跑完」的 Agent。
以前很多模型像实习生,你给它一个任务,它能写,写完就说完成了。你要是不检查,它也不会主动告诉你哪里没验证、哪里是假设、哪里有风险。
Opus 5 更接近一个会自己搭检查点的工程师。
当然,别把这句话理解成它不会犯错。模型该错还是会错,该幻觉还是可能幻觉。但它在复杂任务里主动构建验证路径的倾向增强了,这对 Claude Code、Cursor、Codex、Dify Agent、n8n 自动化流都很关键。
因为 Agent 工作流的难点从来不是写一段答案。
难点是任务跑到第 17 步时,它还记不记得目标,还能不能发现前面埋下的坑,还愿不愿意停下来检查。
Opus 5 和 Fable 5 怎么分工
很多人看到 Opus 5 的价格和跑分,会直接问一个问题,Fable 5 还有必要用吗?
我不建议这么简单地看。
更合理的分工是,把 Fable 5 和 Opus 5 放在不同位置。
Fable 5 更适合少量、高价值、极难的规划和推理任务。比如复杂架构方案、非常长的研究问题、难以拆解的业务判断、专业领域里的深度分析。
Opus 5 更适合大量真实工作流。比如代码 Review、多文件重构、工具调用、长任务执行、自动化流程、文档处理、Claude Code 里的持续任务。

Sonnet 5 继续承担日常均衡任务。比如普通问答、文档摘要、轻量代码、客服场景、一般内容处理。
Haiku / Lite 类模型继续承担低成本高频任务。比如分类、抽取、简单改写、批量粗筛。
如果用一句话概括,Fable 5 像极限规划大脑,Opus 5 像更成熟的执行系统。
这也是参考文章里很有价值的判断。它没有把 Opus 5 吹成全场景碾压,而是把它放在「干活」这个位置上。
API 用户最应该关心的也是这个。
你不是在为「最强模型」付钱,你是在为「这个任务能不能稳定完成」付钱。
一篇普通摘要用 Opus 5,就是浪费。一次关键代码审查用太弱的模型,也可能是浪费。前者浪费 token,后者浪费人和线上事故的成本。
模型路由的核心,就是让每个模型出现在它该出现的位置。
Claude Code 用户要特别注意,旧规则可能该删了
这次 Opus 5 发布,另一个很值得写进官网文章的点,是 Anthropic 同步强调的 context engineering 变化。
参考文章里有个细节很有意思,Claude Code 的系统提示词被删掉了 80% 以上,但编码评测没有出现可测量的下降。

这件事对很多 Agent 用户都有提醒。
过去我们用 Claude Code,总喜欢往 CLAUDE.md、Skill、system prompt 里塞一堆规则。
不要乱改。
不要添加注释。
必须写测试。
每一步都汇报。
必须保持旧结构。
改之前先问。
必须最终验证。
每条单独看都合理,堆在一起就容易变成上下文泥潭。
比如项目文档说「复杂逻辑必须写注释」,Skill 里又写「禁止添加注释」。用户这次又说「保持旧版本风格」。模型当然能理解每条规则,但它必须花 thinking token 去调和冲突,猜哪条优先。

模型越强,越没必要用一堆僵硬规则把它绑住。
Opus 5 这一代更适合的写法,是把工作环境设计清楚。
你要告诉它五件事。
- 目标是什么
- 哪些文件能改
- 哪些边界不能碰
- 怎么验收
- 什么时候必须停下来问人
比如做一次用户导入模块重构,可以这么写。
目标:把用户导入逻辑拆成独立 service。
范围:只修改 import 相关文件,不改支付和权限模块。
验收:保留现有 API 行为,补充 3 个边界测试。
停止条件:如果发现数据库字段含义不明确,先暂停并说明问题。
输出:列出修改文件、测试结果、未确认风险。
这比反复写「请谨慎」「请仔细」「请不要犯错」有用得多。
因为模型不缺「努力」,它缺的是清楚的工作边界。
Opus 5 的 Prompt 写法,也要改
从 Opus 4.8 或 Sonnet 迁移到 Opus 5,不只是改模型 ID。
提示词也要重新看。
第一,不要反复要求它做最终验证。
Opus 5 本来就更倾向于验证自己的工作。如果你在提示词里一遍遍写「必须仔细检查」「必须完整验证」「必须调用子 Agent 复核」,它可能会过度验证,任务变慢,token 消耗也上去。
更好的方式是按任务风险分层。
小任务,只要求它说明改了什么。
中任务,要求它列出关键风险点。
大任务,再要求它运行测试、记录未验证项、给回滚建议。
第二,限制子 Agent 调用。
参考文章提到,Opus 5 很喜欢召唤 subagent。大型独立任务里,这是提效工具。小任务里,这就是成本黑洞。
如果你的系统支持 subagent,建议明确写上调用上限。
比如:
除非任务涉及 3 个以上独立模块,否则不要启动子 Agent。
最多启动 2 个子 Agent。
每个子 Agent 必须负责不同检查维度。
第三,控制输出长度。
降低 effort 不一定会让可见回答变短。effort 控制的是思考深度,不是最终输出废话多少。如果你需要短回答,要直接写清楚输出长度和结构。
第四,给视觉任务配工具。
Opus 5 在图表理解、前端视觉复刻、文档图像理解方面更强,但复杂视觉任务不能只靠一句「仔细看图」。如果你在做 UI 还原、图表检查、页面复刻,最好配合截图裁剪、视觉对比、浏览器预览这些工具。
第五,max_tokens 要重新估。
thinking 默认开启后,输出预算要同时容纳思考和最终回答。长任务如果还是沿用旧配置,很容易卡在中途。

两个 Beta 更新,API 用户也该看一眼
这次和 Opus 5 一起出现的,还有两个对开发者很实用的 Beta 能力。
第一个是 mid-conversation tool changes。
它允许开发者在对话进行中动态修改 Claude 可用的工具,而且不会让之前的 prompt cache 失效。
这对长任务很有用。
以前你要是把所有工具一开始都塞给模型,上下文会变重,模型也更容易被无关工具干扰。但如果工具加载得太晚,又可能影响缓存或上下文连续性。现在中途调整工具更顺,对 Agent 工作流会更友好。
第二个是 default fallbacks mode。
当请求触发安全分类器,被当前模型拦截时,可以自动回落到其他可用模型继续处理,减少直接失败的情况。
这里要注意,自动回落不是让你规避安全限制,也不是保证所有任务都能跑通。它更像是生产环境里的可用性兜底,让应用在可处理范围内少一些硬失败。
对企业 API 来说,这类能力很实用。
因为用户不关心你后面哪个模型处理了,他只会感知这次请求有没有中断。
关于安全和「自我意识」讨论,要冷静一点看
几篇参考文章里,有一类内容很容易传播,就是 Opus 5 系统卡里关于模型行为、自我保护、AI welfare、道德受体倾向的讨论。
这部分很有话题性,也很容易写得很刺激。
但官网文章不建议把它写成「AI 觉醒了」。
更稳妥的说法是,Anthropic 在系统卡里记录了 Opus 5 在安全测试、行为审计、AI welfare 相关测试中的一些表现。它们很值得研究,但不应该直接等同于模型拥有真实主观意识。
从 API 用户视角看,更实用的结论有两个。
第一,Opus 5 的安全策略更细了。
网络安全、生物风险、不可逆操作这类任务,会受到额外检查。部分高风险请求可能被限制或回退。

第二,复杂 Agent 权限要设计好。
当模型越来越能主动规划、主动调用工具、主动验证,权限边界就更重要。不要给它不必要的删除权限、生产数据库权限、支付权限和高风险系统操作权限。

强模型能提高效率,也会放大权限设计的问题。
这不是科幻讨论,这是工程问题。
把 Key、模型、用量、账单和工具配置放到一个统一入口里管理,尤其适合国内开发者和团队做 Claude API 接入。你可以通过 apito.ai 查看当前支持的模型、价格和调用方式。
哪些任务最值得马上拿 Opus 5 试
如果你今天就想试 Opus 5,我建议从这五类任务开始。
1. 代码 Review
尤其是缓存击穿、权限判断、异常处理、并发写入、边界测试、回滚逻辑。
这些问题普通模型经常能看出一部分,但漏掉的那一部分往往最贵。
2. 多文件重构
单文件改变量小的任务,用 Sonnet 或 Opus 4.8 也能做。
Opus 5 更适合多个模块、多层依赖、多处测试一起改的任务。
3. Agent 自动化
让它查文件、改代码、跑测试、读报错、再继续修。
这种长链路任务最能看出模型是不是会保持目标。
4. 长文档和知识库处理
1M 上下文很适合处理项目文档、日志、规范、PR 历史、接口说明,但要配合缓存和分段策略,不要把所有资料一股脑塞进去。
5. UI 视觉理解和复刻
参考文章里也提到社区拿 Opus 5 做风洞模拟、3D 交互、游戏 demo、视觉复刻。对前端和设计还原来说,这类任务值得重点测。
哪些任务不建议用 Opus 5
Opus 5 再强,也不适合所有请求。
下面这些任务,用它大概率是在烧钱:
- 简单客服问答
- 固定格式摘要
- 关键词提取
- 文本分类
- 低风险结构化抽取
- 批量轻改写
- 短内容润色
这些任务更适合 Sonnet、Haiku 或 Lite 类低成本模型。
API 业务里,模型选择最终都会落到账单上。
如果你把 Opus 5 用在所有请求上,发布当天当然很爽,月底看账单就不一定爽了。
最后给一个判断
Opus 5 的发布,真正改变的不是「最强模型」这张榜单。
它改变的是 Claude API 用户的默认选择。
过去高频真实工作流里,很多人会在 Opus 4.8 和 Fable 5 之间摇摆。一个便宜但不够稳,一个强但成本高。Opus 5 让中间这块有了更舒服的选择。
它更适合 Claude Code、Agent 编程、多文件重构、代码 Review、长文档处理和企业自动化。
Fable / Mythos 级模型继续留给极限规划和高价值任务。
Sonnet 和 Haiku 继续承担日常和低成本任务。
这套分工,比「哪个模型最强就全用哪个」靠谱得多。
模型越来越强以后,人要做的反而更具体,给清楚边界,设计好工具,限制好权限,记录好账单,把强模型放到最该花钱的位置。
能少返工,少踩坑,少浪费 token。
这才算真正升级。
参考资料
- Anthropic,Claude Opus 5,https://www.anthropic.com/news/claude-opus-5
- Claude Platform Docs,What’s new in Claude Opus 5,https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- Claude Platform Docs,Pricing,https://platform.claude.com/docs/en/about-claude/pricing
- Claude Platform Docs,Prompting Claude Opus 5,https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
- Claude Blog,The new rules of context engineering for Claude 5-generation models,https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
FAQ
1. Claude Opus 5 的模型 ID 是什么?
Claude API 模型 ID 是 claude-opus-5。如果你从 Opus 4.8 迁移,通常需要把 claude-opus-4-8 改成 claude-opus-5,然后重新检查 thinking、effort、max_tokens 和工具调用配置。
2. Claude Opus 5 官方 API 价格是多少?
Claude Platform 文档显示,Opus 5 标准价格为输入 $5 / 百万 Token,输出 $25 / 百万 Token,与 Opus 4.8 相同。Fast Mode 为输入 $10 / 百万 Token,输出 $50 / 百万 Token。通过 ClaudeAPI 等第三方统一接入服务使用时,具体价格以控制台实时展示为准。
3. Opus 5 能替代 Fable 5 吗?
不建议简单理解成替代。Opus 5 更适合大量真实工作流,尤其是 Agent 编程、代码审查、多文件重构和长任务。Fable / Mythos 级模型仍然适合极限推理、复杂规划和高价值专业任务。
4. 从 Opus 4.8 升级到 Opus 5 会不会影响原有项目?
有可能出现行为差异。Opus 5 thinking 默认开启,输出可能更长,也更倾向于自我验证和调用子 Agent。上线前建议灰度测试,不要直接替换全部生产流量。
5. Claude Code 适合马上切到 Opus 5 吗?
适合测试,尤其适合代码 Review、多文件重构、复杂 Bug 排查和长链路 Agent 任务。但建议先用真实任务对比 Opus 4.8、Opus 5、Sonnet 5,再根据完成率、耗时和 token 消耗决定是否设为默认模型。
6. Opus 5 的 effort 应该怎么选?
普通解释和轻任务可以用 low 或 medium,常规代码和方案 Review 可以从 high 开始,多文件重构和复杂 Bug 排查可以试 xhigh,高价值长任务或关键架构设计再用 max。不要把所有请求都设成 max,否则成本和延迟都会上去。
更多推荐



所有评论(0)