先给结论:

Claude Opus 5 已于 2026 年 7 月 24 日正式发布。标准 API 价格仍是输入 $5/百万 Token、输出 $25/百万 Token,支持 100 万 Token 上下文和 12.8 万 Token 最大输出。真正需要注意的不是模型 ID,而是 thinking 默认开启,以及在 xhighmax 下禁用 thinking 会直接返回 HTTP 400。

本文基于 Anthropic 官方发布页、Claude Platform 模型文档和价格文档,以及 Artificial Analysis 的独立测量整理。数据核验时间为 2026 年 7 月 25 日。

所有 Benchmark 会明确区分:

  • Confirmed:官方规格或价格;

  • Independent measurement:第三方独立测量;

  • Vendor claim:Anthropic 官方 Benchmark 声明,尚未独立复现。

一、Claude Opus 5 的核心规格

Opus 5 是正式可用模型,API ID 为 claude-opus-5

项目 Claude Opus 5 证据级别
发布时间 2026-07-24 Confirmed
Claude API ID claude-opus-5 Confirmed
上下文窗口 1,000,000 Token Confirmed
最大输出 128,000 Token Confirmed
输入模态 文本、图片 Confirmed
输出模态 文本 Confirmed
Thinking 默认开启 Confirmed
Effort 档位 lowmediumhighxhighmax Confirmed
默认 Effort high Confirmed
最短可缓存 Prompt 512 Token Confirmed

官方说明中有两个容易被忽略的细节。

第一,100 万 Token 既是默认值,也是最大值。Opus 5 没有一个更小的上下文版本需要单独选择。

第二,max_tokens 同时限制 thinking Token 和最终可见输出。原来针对 Opus 4.8 非思考请求设置的输出上限,迁移后可能不够。

官方资料:

二、价格没涨,但一次任务不一定同价

Opus 5 与 Opus 4.8 的标准单价相同,但 Cache、Batch、Fast Mode 和区域参数会让真实成本相差 4 倍。

计费模式 输入价格/百万 Token 输出价格/百万 Token 说明
标准模式 $5.00 $25.00 与 Opus 4.8 相同
5 分钟 Cache Write $6.25 $25.00 输入写入为 1.25 倍
1 小时 Cache Write $10.00 $25.00 输入写入为 2 倍
Cache Hit $0.50 $25.00 输入便宜 90%
Batch API $2.50 $12.50 异步处理,打 5 折
Fast Mode $10.00 $50.00 Claude API 限定,研究预览
美国区域推理 $5.50 $27.50 全部 Token 乘 1.1

Fast Mode 不能与 Batch API 同时使用。Cache 和数据驻留乘数则可能与其他受支持的计费模式叠加。

完整价格以 Claude Platform Pricing 为准。

三、一个 Agent 请求到底多少钱

假设一次代码仓库 Agent 请求使用:

  • 输入:100,000 Token;

  • 输出:20,000 Token。

标准模式成本:

输入成本 = 0.10 × $5  = $0.50
输出成本 = 0.02 × $25 = $0.50
单次总成本 = $1.00

同一 Token 结构在不同模式下:

模式 单次成本 每月 1,000 次
标准 $1.00 $1,000
100K 输入命中 Cache $0.55 $550
Batch API $0.50 $500
Fast Mode $2.00 $2,000
美国区域推理 $1.10 $1,100

这组数字直接说明:

  • 重复的大型 System Prompt 或代码仓库上下文,应该优先做 Prompt Cache;

  • 夜间评测、离线数据处理,应该优先用 Batch;

  • Fast Mode 每月多出的 $1,000,必须由更低延迟带来的业务价值覆盖;

  • “模型价格没涨”不等于“迁移后账单不涨”,因为 thinking 和输出长度可能变化。

再看一个满上下文场景:

1M 输入 + 64K 输出
= 1 × $5 + 0.064 × $25
= $6.60

如果第二次请求的 1M 输入全部命中 Cache:

1 × $0.50 + 0.064 × $25
= $2.10

四、Benchmark:61 分是真的,但 Max 不一定划算

Artificial Analysis 在相同评测体系下测得,Opus 5 Max 的 Intelligence Index 为 61,高于 Opus 4.8 的 56。

Effort Intelligence Index 该评测总成本 评测输出 Token
Medium 56 $1,114.96 29M
High 59 $1,973.77 52M
Xhigh 60 $2,909.91 76M
Max 61 $3,835.51 100M

注意:表中的钱是 Artificial Analysis 跑完整评测套件的总成本,不是普通用户的月账单。

但是它能用于观察成本曲线:

Max 相对 High 的成本增幅
= ($3,835.51 - $1,973.77) / $1,973.77
= 94.3%
​
分数增幅
= 61 - 59
= 2

也就是说,在这套独立评测里,Max 相比 High 多了 2 分,成本接近翻倍。

因此生产环境更合理的做法是:

  1. 默认从 high 开始;

  2. 用真实任务测试 medium 是否能保持验收率;

  3. 只有 High 失败且任务价值很高时,才升级到 xhigh

  4. max 留给最难、失败代价最高的任务。

独立数据来源:

五、官方 Benchmark 和独立评测要分开看

Anthropic 官方给出的结果很强,但仍属于 Vendor Claim。

测试 官方结果 证据级别
Frontier-Bench v0.1 超过 Opus 4.8 两倍,且单任务成本更低 Vendor claim
CursorBench 3.2 Max 与 Fable 5 峰值差距小于 0.5%,单任务成本约一半 Vendor claim
ARC-AGI 3 得分约为第二名的 3 倍 Vendor claim
AutomationBench 同成本下通过率约为第二名的 1.5 倍 Vendor claim
OSWorld 2.0 以略高于三分之一的成本超过 Fable 5 最好结果 Vendor claim

Artificial Analysis 的独立结果包括:

测试 Opus 5 结果 对比
Intelligence Index,Max 61 Fable 5 为 60,GPT-5.6 Sol 为 59,Opus 4.8 为 56
GDPval-AA v2 1861 Elo 比 Fable 5 和 GPT-5.6 Sol 高 100 Elo 以上
AA-Briefcase 1720 Elo 比 Fable 5 高 146 Elo

这并不表示第三方评测绝对正确。它只表示证据来源不同:

  • 官方价格和 API 规格,可以直接当 Confirmed;

  • 官方 Benchmark,只能当已确认的厂商声明;

  • 独立 Benchmark,是第三方测量,但仍受其 Prompt、Agent Harness 和评分方法限制。

六、Python 接入示例

Opus 5 默认开启 thinking,不需要显式传入 thinking 字段。

import anthropic
​
client = anthropic.Anthropic()
​
response = client.messages.create(
    model="claude-opus-5",
    max_tokens=64000,
    output_config={
        "effort": "high"
    },
    messages=[
        {
            "role": "user",
            "content": "定位这个仓库中的根因,修复问题并运行测试。"
        }
    ],
)
​
print(response.content)

cURL 版本:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 64000,
    "output_config": {
      "effort": "high"
    },
    "messages": [
      {
        "role": "user",
        "content": "Review this repository change and run the tests."
      }
    ]
  }'

七、最容易踩坑的 HTTP 400

下面这个组合在 Opus 5 中会返回 HTTP 400:

response = client.messages.create(
    model="claude-opus-5",
    max_tokens=64000,
    thinking={
        "type": "disabled"
    },
    output_config={
        "effort": "max"
    },
    messages=[
        {
            "role": "user",
            "content": "Review this pull request."
        }
    ],
)

原因是:

Opus 5 只允许在 high 或更低 Effort 下禁用 thinking。

修复方式二选一:

# 方案 1:保留 disabled thinking,把 effort 降到 high。
thinking = {"type": "disabled"}
output_config = {"effort": "high"}
# 方案 2:保留 max effort,删除 thinking disabled。
output_config = {"effort": "max"}

官方还提醒:禁用 thinking 时,模型偶尔可能把工具调用写进普通文本,或者输出内部 XML 标签。对于大多数应用,保留 thinking、通过降低 Effort 控制成本会更稳。

八、Opus 4.8 迁移检查表

迁移不是只换模型 ID,至少检查以下 8 项。

检查项 原因
把模型改为 claude-opus-5 使用正式模型 ID
检查 max_tokens thinking 和正文共享输出上限
删除重复的“最终自检”Prompt Opus 5 可能过度验证
检查 disabled thinking xhigh/max 下会 400
记录真实 Effort 不同 Effort 成本差异很大
分开统计 Cache Token 避免只看总输入 Token
检查工具调用结构 thinking disabled 有边缘风险
使用 100-300 个真实任务 Canary 公共 Benchmark 不能替代业务验收

Canary 建议记录:

  • 任务验收率;

  • 人工修改次数;

  • 重试次数;

  • Tool Call、JSON Schema 错误;

  • 输入、Cache、thinking、输出 Token;

  • 首次有效结果延迟;

  • 每个成功任务的总成本。

九、该选 Opus 5、Sonnet 5 还是 Fable 5

模型选择应该按任务价值和失败成本分层。

场景 建议
普通分类、摘要、客服 Sonnet 5 或更便宜模型
复杂代码 Agent Opus 5 High
困难 Debug 升级 Opus 5 Xhigh,必要时 Max
最高能力的长程 Agent Opus 5 Max 与 Fable 5 直接对拍
大规模离线评测 Opus 5 High + Batch
重复大上下文 Opus 5 High + Prompt Cache
极低延迟、用户直接等待 先评估 Sonnet;必要时测试 Fast Mode

Opus 5 的短板也很明确:

  • 输出价格高;

  • 深度推理延迟长;

  • Max 的边际收益可能很贵;

  • 默认输出更长;

  • 闭源权重,不能本地部署;

  • 迁移存在行为变化。

十、可用渠道

Anthropic 官方确认 Opus 5 已覆盖:

渠道 模型标识 状态
Claude API claude-opus-5 已上线
Amazon Bedrock anthropic.claude-opus-5 已上线
Google Cloud claude-opus-5 已上线
Microsoft Foundry 平台部署 已上线

Fast Mode 当前只在 Anthropic 第一方 Claude API 提供。

截至 2026 年 7 月 25 日核验时,TokenMix 公共模型目录尚未出现 Opus 5,只列出了 Opus 4.8、Opus 4.7、Sonnet 5 和 Fable 5。不要自行构造不存在的路由,也不要假设网关会自动映射。

总结

Claude Opus 5 的升级是真的:

  • 与 Opus 4.8 同价;

  • 100 万上下文;

  • 12.8 万最大输出;

  • 独立 Intelligence Index 从 56 提升到 61;

  • 长程 Agent、代码和知识工作能力明显增强。

但生产建议不是“全部切 Max”。

最稳妥的路径是:Opus 5 High 做 Canary,Medium 测成本下限,Xhigh/Max 只处理 High 失败的高价值任务。

完整英文数据表和来源汇总:

Claude Opus 5 Review 2026: Pricing, Benchmarks, API Changes

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐