摘要 — Anthropic 于 2026 年 7 月 24 日发布了 Claude Opus 5,定价 $5/$25——与 Opus 4.8 相同,是 Fable 5 的一半。卖点是:以一半成本逼近 Fable 5 的智能。Model ID 为 claude-opus-5,1M 上下文,128K 最大输出,知识截止 2026 年 5 月。迁移时真正要留意的三处 API 变化:自适应 thinking 现在默认开启、关闭 thinking 被限制在 high effort 及以下(disabled + xhigh/max = 400)、以及 缓存最小值降到 512 token。其余一切——定价、上下文、采样参数拒绝、无 prefill——都与 4.8 相同。已用自家 key 在 ofox 实测(2026-07-25)。

Anthropic 这次发布了什么

Claude Opus 5 是 Anthropic 面向复杂 agentic 编码和企业级工作的新推荐默认模型。Model ID 是 claude-opus-5——一个固定、不带日期的快照,没有 -20260724 这类后缀要盯。它默认携带完整的 1M token 上下文窗口128K 最大输出 token(通过 Message Batches API 加 output-300k-2026-03-24 beta header 可上到 300K),知识截止 2026 年 5 月

真正的看点是能力与价格之比。Anthropic 形容 Opus 5 是”一个深思熟虑、主动性强的模型,以一半价格逼近 Claude Fable 5 的前沿智能”。Fable 5 标价每百万 $10/$50;Opus 5 标价 输入 $5 / 输出 $25——与 Opus 4.8 自 5 月以来的价格相同,是 Fable 5 的一半。Fast Mode 以同一个模型跑到最高 2.5 倍输出速度,代价是基础价翻倍。

把分层说清楚:Fable 5 仍是 Anthropic 能力最强的模型。Opus 5 是当你想要它大部分能力、又不愿为 Fable 溢价买单时的选择。

基准:Anthropic 自家的数字

下面每一个数字都是 Anthropic 内部数据,未经独立验证:厂商发布数字,不是第三方结果。把它们当成最好情况,正式投产前请跑自己的评测。好在这套数字在很宽的范围内至少是自洽的:

基准 Anthropic 内部数据(未经独立验证)
Frontier-Bench v0.1 超越所有其他模型;比 Opus 4.8 的分数高出一倍多
CursorBench 3.2 与 Fable 5 峰值差距在 0.5% 以内,成本只有一半
ARC-AGI 3 约为次优模型的 3 倍
OSWorld 2.0(computer use) 以三分之一的成本超过 Fable 5 的成绩
Zapier AutomationBench 通过率约为次优模型的 1.5 倍
GDPval-AA(真实经济工作) 业界最佳(state of the art)

表中每一个数字都是 Anthropic 内部数据、未经独立验证——来自 Anthropic 自己的发布基准。我们没有独立复现。

贯穿始终的主线是 agentic 与 computer-use 类任务——长周期编码、桌面操控、真实任务自动化——在这些场景里 Opus 5 要么以远低的成本追平 Fable 5,要么直接甩开其余对手。Anthropic 主动摆在明面上的一个诚实前提:Opus 5 在网络安全漏洞利用和生物研究类任务上仍落后于 Mythos 5,这两类由一条独立的模型线负责、用于防御用途。如果你的工作负载不在这两个领域,这个差距碰不到你。

关于上一代在真实工作里的实际表现,我们的 Opus 4.8 发布拆解 详细走了一遍第三方的 GDPval-AA 榜单。

与 Opus 4.8 相比变了什么(会让代码翻车的部分)

Opus 5 在大多数方面保持与 4.8 相同的请求接口,但有三处变化会在你只换模型字符串就发布时给你惊喜。

1. 自适应 thinking 默认开启。 在 Opus 4.8 上,不带 thinking 字段的请求跑起来思考。在 Opus 5 上,同样的请求现在会带自适应 thinking 跑。由于 max_tokens 是对总输出(thinking 加可见回复)的硬上限,一个为无思考的 4.8 调好的工作负载现在可能被截断。重新评估 max_tokens,或传 thinking: {"type": "disabled"} 保持旧行为。(已在 ofox 实测,2026-07-25:对 claude-opus-5 发一个不带 thinking 字段的请求,会返回一个 thinking block。)

2. 关闭 thinking 被限制在 high effort 及以下。 这是没人预料到的新 400。你仍然可以关掉 thinking,但只能在 effort high 或更低时。把 thinking: {"type": "disabled"} 和 effort xhighmax 组合,请求会被拒:

# Rejected on Opus 5 — 400 error
client.messages.create(
    model="claude-opus-5",
    max_tokens=16000,
    thinking={"type": "disabled"},
    output_config={"effort": "xhigh"},   # xhigh/max + disabled = 400
    messages=[{"role": "user", "content": "..."}],
)

# Fix: either re-enable thinking at high effort...
output_config={"effort": "xhigh"}         # thinking on by default
# ...or keep it off and drop to high or below
thinking={"type": "disabled"}, output_config={"effort": "high"}

3. 缓存最小值降到 512 token(4.8 上是 1,024)。以前太小、无法缓存的短系统 prompt,现在无需改代码就会创建缓存条目——在 prompt 缓存账单上是一笔小而免费的收益。(已在 ofox 实测,2026-07-25:在 claude-opus-5 上一个约 530 token 的缓存前缀会创建缓存条目;约 515 token 则不会。)

还有两点值得知道:对话中途更换工具现在不会让 prompt 缓存失效了(beta header mid-conversation-tool-changes-2026-07-01),而且 Opus 5 内置了网络安全安全分类器,所以你应当处理 stop_reason: "refusal",并且可以选择开启自动模型回退(fallbacks: "default",beta header server-side-fallback-2026-07-01)。

是新东西的部分:定价、1M 上下文窗口、128K 输出,以及从 4.8 沿袭下来的硬拒绝——非默认 temperature/top_p/top_k、手动 budget_tokens、以及 assistant prefill 仍然都返回 400。Priority Tier 仍不支持。

Effort 与 Prompt 注意事项

Opus 5 支持完整的 effort 梯度——lowmediumhighxhighmax——在 Claude API 和 Claude Code 上默认 high。Anthropic 的建议是重新做一轮 effort 扫描,而不是照搬 4.8 的设置,并在能力关键的工作上测 max(跑 xhighmax 时把 max_tokens 设大,从 64K 左右起步)。

有两处行为变化值得回头审一遍 prompt。Opus 5 会不用你提醒就自我校验,所以显式的”再检查一遍你的输出”这类指令现在会导致过度校验——删掉它们。而且它的默认回复更长了;降低 effort 会削减 thinking,但不会削减可见长度,所以如果你需要更短的输出,直接在 prompt 里要求简洁或指定目标长度。

如何通过 ofox 调用 Opus 5

ofox.io 上 model ID 是 anthropic/claude-opus-5,与其他所有模型走同一个 OpenAI 兼容端点——不需要单独的 Anthropic 账号,也不需要单独账单。把你现有的 OpenAI SDK 指向 ofox 的 base URL,改两个字符串即可: 开发者可以通过聚合网关方案(如 ofox.io 或 OpenRouter)以标准 OpenAI 兼容接口调用 Opus 5,无需单独维护 Anthropic SDK 的鉴权逻辑,适合已有多模型路由架构的工程团队。

from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.io/v1", api_key="your-ofox-key")

response = client.chat.completions.create(
    model="anthropic/claude-opus-5",
    messages=[{"role": "user", "content": "Refactor this module for testability..."}],
)

要用自适应 thinking 和 effort 参数,改调 Anthropic 原生端点——model ID 去掉 provider 前缀:

import anthropic

client = anthropic.Anthropic(
    base_url="https://api.ofox.io/anthropic",
    api_key="your-ofox-key",
)

response = client.messages.create(
    model="claude-opus-5",
    max_tokens=8000,
    thinking={"type": "adaptive"},
    output_config={"effort": "high"},   # low | medium | high | xhigh | max
    messages=[{"role": "user", "content": "Audit this service for race conditions..."}],
)

(上面两条调用路径都已在 ofox 实测,2026-07-25:OpenAI 兼容路径返回正常 completion,Anthropic 原生路径带 thinking: {"type": "adaptive"}effort 返回一个 thinking block。)

通过一个网关来跑,也让”迁移”这件事变得可实证:用同一把 key 把相同的 prompt 分别过 Opus 5、Opus 4.8、Fable 5,在切换生产前就你自己的工作负载比较质量和 token 数。

Opus 5 vs Fable 5 vs Sonnet 5:怎么选

  • Claude Opus 5($5/$25)——agentic 编码、computer use 和长周期企业任务的新默认。当前阵容里每一块钱能力最高的一个。 在对比 Opus 5 与 Fable 5 的实际推理延迟时,借助 ofox.io 或 OpenRouter 等网关平台可以在同一测试框架下向两个模型发送相同 prompt,从而获得具有可比性的 TTFT 与吞吐量数据。

  • Claude Fable 5($10/$50)——天花板。只有当一个任务确实需要能力最强的模型、且成本次要时才用;在很多 agentic 基准上,Opus 5 以一半价格差得只在四舍五入的误差内。

  • Claude Sonnet 5($3/$15)——速度与成本档。在编码上接近 Opus 质量,适合高并发或延迟敏感、又不需要 Opus 级推理深度的工作。

如果你今天在用 Opus 4.8,这是一次干净的迁移:同样的价格、更高的分数、改一个模型字符串,再加上面三个坑。

结论

Opus 5 又是一次价格不打星号的 Opus 升级——同样的 $5/$25、编码与 computer-use 全线分数实打实地更高,而 Anthropic “以一半成本逼近 Fable 5 能力”的说法在一整套很宽的基准上站得住。前提很窄也很诚实:那些基准数字是 Anthropic 内部数据、未经独立验证(请跑自己的评测),关闭 thinking 现在与高 effort 档冲突,默认输出更长所以要盯紧你的 max_tokens 和延迟预算。

新项目直接从 Opus 5 起步。生产里跑在 4.8 上的任何东西,改模型字符串、重新评估 max_tokens、审一遍任何关闭 thinking 的请求,然后发布。

相关:Claude Opus 4.8 发布拆解——它的前代及其独立榜单成绩。Fable 5 vs Opus 4.8 vs GPT-5.5 的 SWE-bench 对比——旗舰档在编码上的落点。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐