OpenAI、Claude、Gemini API都在降价:2026年开发者该怎么选?
最近如果一直在用大模型 API,应该会发现一个变化:
模型能力还在往上走,调用价格却在往下压。
OpenAI 7 月底调整了 GPT-5.6 Terra 和 Luna 的价格,8 月又给 Sol 做了阶段性降价;Anthropic 把 Claude Sonnet 5 原本的首发优惠价直接改成长期价格;Google 则给 Gemini 3.7 Flash 和 3.6 Flash 设置了持续到年底的优惠价格。
现在做 API 项目,已经很难只问一句:
哪个模型最强?
更实际的问题应该是:
完成同一个任务,哪一个模型的总成本更低?
客服、内容生成、代码 Agent、文档处理一旦跑到生产环境,每天可能就是几十万甚至上千万 Token。每百万 Token 相差几美元,放大到一个月以后就不是小数目了。
一、OpenAI:开始把不同成本的任务拆给不同模型
GPT-5.6 现在比较明显的特点,就是模型分层。
目前主要可以看三个档位:
-
GPT-5.6 Sol
-
GPT-5.6 Terra
-
GPT-5.6 Luna
GPT-5.6 Sol
截至 2026 年 8 月 26 日,Sol 的阶段性 API 价格为:
| 项目 | 价格 / 100万 Token |
|---|---|
| 输入 | $4 |
| 缓存输入 | $0.40 |
| 输出 | $20 |
这轮价格至少持续到 2026 年 11 月 21 日。相比之前的 $5 输入、$30 输出,输入价格下降 20%,输出下降约 33%。
Sol还是偏复杂任务。
例如:
-
高难度推理
-
大型代码项目
-
复杂Agent
-
专业知识工作
-
多工具协同
如果只是做分类、摘要,直接全程跑Sol,通常没太大必要。
GPT-5.6 Terra
Terra现在是:
| 项目 | 价格 |
|---|---|
| 输入 | $2 / 100万 Token |
| 缓存输入 | $0.20 |
| 输出 | $12 / 100万 Token |
OpenAI把它定位成兼顾能力和成本的型号,更适合作为大量日常开发任务的默认模型。
GPT-5.6 Luna
Luna这次价格调整更明显:
| 项目 | 价格 |
|---|---|
| 输入 | $0.20 / 100万 Token |
| 缓存输入 | $0.02 |
| 输出 | $1.20 / 100万 Token |
7 月 30 日之前,Luna还是 $1 输入、$6 输出,现在价格已经降了很多。
这类模型很适合:
分类
摘要
标签生成
简单信息提取
批量文本处理
基础自动化
100 万输入 Token 只需要 0.2 美元。
如果项目每天都要处理大量文本,这种价格差距很容易在账单上体现出来。
OpenAI现在的思路其实很好理解:
简单、大量任务 → Luna
日常开发、Agent → Terra
复杂、高价值任务 → Sol
相比“所有请求都扔给旗舰模型”,这种方式更适合真正跑生产项目。
二、Claude:Sonnet 5现在最有吸引力的是Coding和Agent
Anthropic这边,现在比较值得看的还是 Claude Sonnet 5。
当前长期价格已经确定为:
| 项目 | 价格 |
|---|---|
| 输入 | $2 / 100万 Token |
| 输出 | $10 / 100万 Token |
Sonnet 5刚发布时,这个价格原本只是首发优惠,计划之后恢复到 $3 / $15。
但 Anthropic 在 8 月 10 日更新了规则:
$2 / $10直接变成长期价格。
这个变化很重要。
因为Claude现在比较有优势的使用场景,本身就是Token消耗比较大的:
-
Claude Code
-
Coding Agent
-
浏览器操作
-
多工具调用
-
长任务
-
大型代码库分析
普通聊天可能就是:
用户问题
→
模型回答
Agent不是这样。
实际过程可能变成:
读取代码
→
分析
→
搜索文件
→
修改
→
运行测试
→
发现报错
→
继续修改
→
再次测试
一条用户指令,背后可能已经运行了很多轮模型。
Anthropic自己也把Sonnet 5定位为更偏Agent、Coding和专业工作的一代Sonnet。
所以它并不是在打“最低单价”。
更像是在抢:
复杂Coding和Agent任务里的单位任务成本。
还有更贵的Claude Opus 5,目前是:
-
输入:$5 / 100万 Token
-
输出:$25 / 100万 Token
更适合对复杂代码、长时间Agent和高价值任务有更高要求的场景。
三、Gemini:Flash系列正在把价格压得很低
Google这边最近的变化也很快。
8月最新的 Gemini 3.7 Flash,以及3.6 Flash,目前都采用阶段性价格:
| 项目 | 2026年底前 | 2027年起 |
|---|---|---|
| 输入 | $0.75 | $1.50 |
| 输出 | $3.75 | $7.50 |
| 缓存输入 | $0.075 | $0.15 |
当前价格持续到 2026 年 12 月 31 日。
这已经不是一个单纯“便宜的小模型”了。
Google现在把3.7 Flash明显往:
-
Coding
-
Agent
-
Web开发
-
搜索与Grounding
-
高频生产任务
这些方向推。
如果项目对模型能力要求不是最高档,但调用量特别大,这个价格就很有竞争力。
再往下还有:
Gemini 3.5 Flash-Lite
目前价格:
| 项目 | 价格 |
|---|---|
| 输入 | $0.30 / 100万 Token |
| 输出 | $2.50 / 100万 Token |
| 缓存输入 | $0.03 |
Google对它的定位本身就是高调用量Agent、翻译和简单数据处理。
所以如果做的是:
大量翻译
文本分类
结构化提取
数据清洗
内容审核
简单Agent任务
Gemini这一档确实很容易把平均成本压下来。
四、把几家的价格放在一起看
以目前比较有代表性的型号为例:
| 模型 | 输入 / 100万Token | 输出 / 100万Token | 更适合 |
|---|---|---|---|
| GPT-5.6 Sol | $4 | $20 | 高难度推理、复杂专业任务 |
| GPT-5.6 Terra | $2 | $12 | 日常开发、Agent、通用任务 |
| GPT-5.6 Luna | $0.20 | $1.20 | 大批量低成本任务 |
| Claude Sonnet 5 | $2 | $10 | Coding、Agent、复杂执行 |
| Claude Opus 5 | $5 | $25 | 高难度编程、长任务 |
| Gemini 3.7 / 3.6 Flash | $0.75 | $3.75 | 高频调用、Agent、通用任务 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 翻译、分类、简单处理 |
注:以上为截至2026年8月26日官方公布的标准或阶段性价格。缓存、Batch、长上下文、Fast/Priority、搜索Grounding和其他工具可能另外计费,实际项目应以调用时官方Pricing页面为准。
只看这张表,很容易得出一个结论:
Gemini和GPT-5.6 Luna的Token成本已经压得很低。
但这还不能直接证明:
Gemini一定最省钱,或者Luna一定性价比最高。
原因是API真正应该算的不是Token单价,而是完成一次任务的成本。
五、API成本不能只看每百万Token多少钱
假设现在有两个模型:
模型A:
每次任务 $0.01
成功率高
模型B:
每次任务 $0.006
但经常要重试
如果B平均执行两次才能得到满意结果:
$0.006 × 2 = $0.012
最终反而比A贵。
Agent场景尤其明显。
一次任务可能包含:
模型推理
+
重新读取上下文
+
搜索
+
工具调用
+
代码执行
+
失败重试
+
最终输出
这时候真正值得统计的是:
Cost per Task
也就是:
完成一个完整任务平均花多少钱。
而不是:
100万Token多少钱。
这个指标对于实际项目更有参考价值。
六、输出Token往往比输入更值得控制
看前面的价格表也能发现一个规律:
输出普遍比输入贵。
比如GPT-5.6 Terra:
输入:$2
输出:$12
Claude Sonnet 5:
输入:$2
输出:$10
GPT-5.6 Sol:
输入:$4
输出:$20
所以做大量:
-
长报告
-
长代码
-
商品内容
-
自动报告
-
Agent执行总结
时,不要只花时间缩短Prompt。
限制无意义输出通常更有效。
例如本来只是需要:
{
"category": "refund"
}
就没有必要让模型再解释500字:
“根据您提供的信息,我认为该用户的主要诉求……”
生产系统和Chat界面的设计思路不应该完全一样。
七、实际项目更适合做模型分层
现在三个平台都有不同价格层级以后,我反而不建议项目只绑定一个模型。
可以按照任务复杂程度路由。
例如:
用户请求
↓
判断任务类型
↓
简单任务 → 低成本模型
普通任务 → 中档模型
复杂任务 → 高能力模型
具体可以是:
批量处理
优先测试:
-
GPT-5.6 Luna
-
Gemini Flash-Lite
普通开发和自动化
可以比较:
-
GPT-5.6 Terra
-
Claude Sonnet 5
-
Gemini 3.7 Flash
高价值复杂任务
再考虑:
-
GPT-5.6 Sol
-
Claude Opus 5
这里没有固定答案。
最好拿自己的真实数据做A/B测试。
例如记录:
任务成功率
平均Token
平均重试次数
平均响应时间
单任务实际成本
人工返工时间
跑一段时间以后,哪一个更划算基本就能看出来。
八、模型越来越便宜,为什么API账单反而可能增加?
这个现象现在已经越来越明显。
原因并不复杂。
以前:
用户请求一次
→
AI回答一次
现在:
用户给Agent一个任务
↓
Agent自己规划
↓
连续调用模型
↓
搜索网页
↓
读取文件
↓
调用工具
↓
运行代码
↓
失败重试
↓
继续执行
单次Token价格降了,但每个任务消耗的Token数量增加了。
模型便宜以后,开发者也更愿意把AI塞进更多业务流程。
最终可能出现:
单价下降 50%
调用量增加 300%
总账单还是会上涨。
所以到了Agent阶段,API成本管理的重要性其实比过去更高。
九、多平台同时测试时,账单最好拆开管理
现在很多开发团队并不会只使用一家API。
很常见的是:
OpenAI
+
Claude
+
Gemini
+
其他AI开发服务
研发阶段可能这个模型跑Coding,另一个负责批量处理,再用第三个模型做Fallback。
如果API、AI Coding工具和海外SaaS全部使用同一个付款方式,后期做费用归属会比较麻烦。
比较清晰的思路是:
模型A → 独立项目预算
模型B → 独立项目预算
测试环境 → 较低额度
生产环境 → 单独管理
付款层也可以采用类似逻辑。
如果本身使用MXK8这类虚拟卡方案,可以按AI平台或项目分卡,并设置相应额度,用于区分不同服务的支出。
虚拟卡在这里更适合作为付款和费用归集工具,而不是API预算系统的替代品。
实际绑定前仍要确认:
-
平台当前接受的卡片类型;
-
发卡地区;
-
Billing Address;
-
是否涉及周期性扣款;
-
API平台当前支付规则。
最终预算控制还是建议同时结合平台自身的Usage Limit、项目限额和代码侧调用限制。
十、现在到底谁的API最划算?
如果非要给一个非常简化的答案:
大批量低成本文本任务
可以重点测试:
GPT-5.6 Luna、Gemini 3.5 Flash-Lite。
Coding和Agent
目前:
Claude Sonnet 5、GPT-5.6 Terra、Gemini 3.7 Flash都值得实际跑一次自己的任务。
其中Sonnet 5目前的 $2 / $10 定价,对Coding和Agent场景比较有竞争力。
高难度专业任务
更适合比较:
GPT-5.6 Sol和Claude Opus 5。
价格更高,但这类任务真正应该看的不是一次调用贵几分钱,而是模型能不能一次完成。
写在最后
这一轮API价格变化,我觉得真正值得关注的不是:
OpenAI、Claude、Gemini到底谁便宜几毛钱。
而是整个大模型市场正在进入一个新的阶段。
过去主要比:
谁的模型更强
现在开始同时比:
谁能以更低成本
稳定完成真实任务
OpenAI在做模型分层;
Anthropic把Sonnet 5的优惠价格直接改成长期价格;
Google则继续用Flash系列压低大规模调用成本。
对开发者来说,这其实是好事。
现在没必要先站队。
拿自己的业务数据跑一遍,统计成功率、Token、重试次数和单任务成本。
最后谁便宜,账单会比Benchmark告诉你得更清楚。
更多推荐


所有评论(0)