Claude Opus 5 API 解析:$5/$25、1M 上下文、5 档 Effort 与 400 错误
先给结论:
Claude Opus 5 已于 2026 年 7 月 24 日正式发布。标准 API 价格仍是输入 $5/百万 Token、输出 $25/百万 Token,支持 100 万 Token 上下文和 12.8 万 Token 最大输出。真正需要注意的不是模型 ID,而是 thinking 默认开启,以及在 xhigh、max 下禁用 thinking 会直接返回 HTTP 400。
本文基于 Anthropic 官方发布页、Claude Platform 模型文档和价格文档,以及 Artificial Analysis 的独立测量整理。数据核验时间为 2026 年 7 月 25 日。
所有 Benchmark 会明确区分:
-
Confirmed:官方规格或价格;
-
Independent measurement:第三方独立测量;
-
Vendor claim:Anthropic 官方 Benchmark 声明,尚未独立复现。
一、Claude Opus 5 的核心规格
Opus 5 是正式可用模型,API ID 为 claude-opus-5。
| 项目 | Claude Opus 5 | 证据级别 |
|---|---|---|
| 发布时间 | 2026-07-24 | Confirmed |
| Claude API ID | claude-opus-5 |
Confirmed |
| 上下文窗口 | 1,000,000 Token | Confirmed |
| 最大输出 | 128,000 Token | Confirmed |
| 输入模态 | 文本、图片 | Confirmed |
| 输出模态 | 文本 | Confirmed |
| Thinking | 默认开启 | Confirmed |
| Effort 档位 | low、medium、high、xhigh、max |
Confirmed |
| 默认 Effort | high |
Confirmed |
| 最短可缓存 Prompt | 512 Token | Confirmed |
官方说明中有两个容易被忽略的细节。
第一,100 万 Token 既是默认值,也是最大值。Opus 5 没有一个更小的上下文版本需要单独选择。
第二,max_tokens 同时限制 thinking Token 和最终可见输出。原来针对 Opus 4.8 非思考请求设置的输出上限,迁移后可能不够。
官方资料:
二、价格没涨,但一次任务不一定同价
Opus 5 与 Opus 4.8 的标准单价相同,但 Cache、Batch、Fast Mode 和区域参数会让真实成本相差 4 倍。
| 计费模式 | 输入价格/百万 Token | 输出价格/百万 Token | 说明 |
|---|---|---|---|
| 标准模式 | $5.00 | $25.00 | 与 Opus 4.8 相同 |
| 5 分钟 Cache Write | $6.25 | $25.00 | 输入写入为 1.25 倍 |
| 1 小时 Cache Write | $10.00 | $25.00 | 输入写入为 2 倍 |
| Cache Hit | $0.50 | $25.00 | 输入便宜 90% |
| Batch API | $2.50 | $12.50 | 异步处理,打 5 折 |
| Fast Mode | $10.00 | $50.00 | Claude API 限定,研究预览 |
| 美国区域推理 | $5.50 | $27.50 | 全部 Token 乘 1.1 |
Fast Mode 不能与 Batch API 同时使用。Cache 和数据驻留乘数则可能与其他受支持的计费模式叠加。
完整价格以 Claude Platform Pricing 为准。
三、一个 Agent 请求到底多少钱
假设一次代码仓库 Agent 请求使用:
-
输入:100,000 Token;
-
输出:20,000 Token。
标准模式成本:
输入成本 = 0.10 × $5 = $0.50 输出成本 = 0.02 × $25 = $0.50 单次总成本 = $1.00
同一 Token 结构在不同模式下:
| 模式 | 单次成本 | 每月 1,000 次 |
|---|---|---|
| 标准 | $1.00 | $1,000 |
| 100K 输入命中 Cache | $0.55 | $550 |
| Batch API | $0.50 | $500 |
| Fast Mode | $2.00 | $2,000 |
| 美国区域推理 | $1.10 | $1,100 |
这组数字直接说明:
-
重复的大型 System Prompt 或代码仓库上下文,应该优先做 Prompt Cache;
-
夜间评测、离线数据处理,应该优先用 Batch;
-
Fast Mode 每月多出的 $1,000,必须由更低延迟带来的业务价值覆盖;
-
“模型价格没涨”不等于“迁移后账单不涨”,因为 thinking 和输出长度可能变化。
再看一个满上下文场景:
1M 输入 + 64K 输出 = 1 × $5 + 0.064 × $25 = $6.60
如果第二次请求的 1M 输入全部命中 Cache:
1 × $0.50 + 0.064 × $25 = $2.10
四、Benchmark:61 分是真的,但 Max 不一定划算
Artificial Analysis 在相同评测体系下测得,Opus 5 Max 的 Intelligence Index 为 61,高于 Opus 4.8 的 56。
| Effort | Intelligence Index | 该评测总成本 | 评测输出 Token |
|---|---|---|---|
| Medium | 56 | $1,114.96 | 29M |
| High | 59 | $1,973.77 | 52M |
| Xhigh | 60 | $2,909.91 | 76M |
| Max | 61 | $3,835.51 | 100M |
注意:表中的钱是 Artificial Analysis 跑完整评测套件的总成本,不是普通用户的月账单。
但是它能用于观察成本曲线:
Max 相对 High 的成本增幅 = ($3,835.51 - $1,973.77) / $1,973.77 = 94.3% 分数增幅 = 61 - 59 = 2
也就是说,在这套独立评测里,Max 相比 High 多了 2 分,成本接近翻倍。
因此生产环境更合理的做法是:
-
默认从
high开始; -
用真实任务测试
medium是否能保持验收率; -
只有 High 失败且任务价值很高时,才升级到
xhigh; -
max留给最难、失败代价最高的任务。
独立数据来源:
五、官方 Benchmark 和独立评测要分开看
Anthropic 官方给出的结果很强,但仍属于 Vendor Claim。
| 测试 | 官方结果 | 证据级别 |
|---|---|---|
| Frontier-Bench v0.1 | 超过 Opus 4.8 两倍,且单任务成本更低 | Vendor claim |
| CursorBench 3.2 | Max 与 Fable 5 峰值差距小于 0.5%,单任务成本约一半 | Vendor claim |
| ARC-AGI 3 | 得分约为第二名的 3 倍 | Vendor claim |
| AutomationBench | 同成本下通过率约为第二名的 1.5 倍 | Vendor claim |
| OSWorld 2.0 | 以略高于三分之一的成本超过 Fable 5 最好结果 | Vendor claim |
Artificial Analysis 的独立结果包括:
| 测试 | Opus 5 结果 | 对比 |
|---|---|---|
| Intelligence Index,Max | 61 | Fable 5 为 60,GPT-5.6 Sol 为 59,Opus 4.8 为 56 |
| GDPval-AA v2 | 1861 Elo | 比 Fable 5 和 GPT-5.6 Sol 高 100 Elo 以上 |
| AA-Briefcase | 1720 Elo | 比 Fable 5 高 146 Elo |
这并不表示第三方评测绝对正确。它只表示证据来源不同:
-
官方价格和 API 规格,可以直接当 Confirmed;
-
官方 Benchmark,只能当已确认的厂商声明;
-
独立 Benchmark,是第三方测量,但仍受其 Prompt、Agent Harness 和评分方法限制。
六、Python 接入示例
Opus 5 默认开启 thinking,不需要显式传入 thinking 字段。
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=64000,
output_config={
"effort": "high"
},
messages=[
{
"role": "user",
"content": "定位这个仓库中的根因,修复问题并运行测试。"
}
],
)
print(response.content)
cURL 版本:
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 64000,
"output_config": {
"effort": "high"
},
"messages": [
{
"role": "user",
"content": "Review this repository change and run the tests."
}
]
}'
七、最容易踩坑的 HTTP 400
下面这个组合在 Opus 5 中会返回 HTTP 400:
response = client.messages.create(
model="claude-opus-5",
max_tokens=64000,
thinking={
"type": "disabled"
},
output_config={
"effort": "max"
},
messages=[
{
"role": "user",
"content": "Review this pull request."
}
],
)
原因是:
Opus 5 只允许在 high 或更低 Effort 下禁用 thinking。
修复方式二选一:
# 方案 1:保留 disabled thinking,把 effort 降到 high。
thinking = {"type": "disabled"}
output_config = {"effort": "high"}
# 方案 2:保留 max effort,删除 thinking disabled。
output_config = {"effort": "max"}
官方还提醒:禁用 thinking 时,模型偶尔可能把工具调用写进普通文本,或者输出内部 XML 标签。对于大多数应用,保留 thinking、通过降低 Effort 控制成本会更稳。
八、Opus 4.8 迁移检查表
迁移不是只换模型 ID,至少检查以下 8 项。
| 检查项 | 原因 |
|---|---|
把模型改为 claude-opus-5 |
使用正式模型 ID |
检查 max_tokens |
thinking 和正文共享输出上限 |
| 删除重复的“最终自检”Prompt | Opus 5 可能过度验证 |
| 检查 disabled thinking | xhigh/max 下会 400 |
| 记录真实 Effort | 不同 Effort 成本差异很大 |
| 分开统计 Cache Token | 避免只看总输入 Token |
| 检查工具调用结构 | thinking disabled 有边缘风险 |
| 使用 100-300 个真实任务 Canary | 公共 Benchmark 不能替代业务验收 |
Canary 建议记录:
-
任务验收率;
-
人工修改次数;
-
重试次数;
-
Tool Call、JSON Schema 错误;
-
输入、Cache、thinking、输出 Token;
-
首次有效结果延迟;
-
每个成功任务的总成本。
九、该选 Opus 5、Sonnet 5 还是 Fable 5
模型选择应该按任务价值和失败成本分层。
| 场景 | 建议 |
|---|---|
| 普通分类、摘要、客服 | Sonnet 5 或更便宜模型 |
| 复杂代码 Agent | Opus 5 High |
| 困难 Debug 升级 | Opus 5 Xhigh,必要时 Max |
| 最高能力的长程 Agent | Opus 5 Max 与 Fable 5 直接对拍 |
| 大规模离线评测 | Opus 5 High + Batch |
| 重复大上下文 | Opus 5 High + Prompt Cache |
| 极低延迟、用户直接等待 | 先评估 Sonnet;必要时测试 Fast Mode |
Opus 5 的短板也很明确:
-
输出价格高;
-
深度推理延迟长;
-
Max 的边际收益可能很贵;
-
默认输出更长;
-
闭源权重,不能本地部署;
-
迁移存在行为变化。
十、可用渠道
Anthropic 官方确认 Opus 5 已覆盖:
| 渠道 | 模型标识 | 状态 |
|---|---|---|
| Claude API | claude-opus-5 |
已上线 |
| Amazon Bedrock | anthropic.claude-opus-5 |
已上线 |
| Google Cloud | claude-opus-5 |
已上线 |
| Microsoft Foundry | 平台部署 | 已上线 |
Fast Mode 当前只在 Anthropic 第一方 Claude API 提供。
截至 2026 年 7 月 25 日核验时,TokenMix 公共模型目录尚未出现 Opus 5,只列出了 Opus 4.8、Opus 4.7、Sonnet 5 和 Fable 5。不要自行构造不存在的路由,也不要假设网关会自动映射。
总结
Claude Opus 5 的升级是真的:
-
与 Opus 4.8 同价;
-
100 万上下文;
-
12.8 万最大输出;
-
独立 Intelligence Index 从 56 提升到 61;
-
长程 Agent、代码和知识工作能力明显增强。
但生产建议不是“全部切 Max”。
最稳妥的路径是:Opus 5 High 做 Canary,Medium 测成本下限,Xhigh/Max 只处理 High 失败的高价值任务。
完整英文数据表和来源汇总:
更多推荐


所有评论(0)