最近如果一直在用大模型 API,应该会发现一个变化:

模型能力还在往上走,调用价格却在往下压。

OpenAI 7 月底调整了 GPT-5.6 Terra 和 Luna 的价格,8 月又给 Sol 做了阶段性降价;Anthropic 把 Claude Sonnet 5 原本的首发优惠价直接改成长期价格;Google 则给 Gemini 3.7 Flash 和 3.6 Flash 设置了持续到年底的优惠价格。

现在做 API 项目,已经很难只问一句:

哪个模型最强?

更实际的问题应该是:

完成同一个任务,哪一个模型的总成本更低?

客服、内容生成、代码 Agent、文档处理一旦跑到生产环境,每天可能就是几十万甚至上千万 Token。每百万 Token 相差几美元,放大到一个月以后就不是小数目了。


一、OpenAI:开始把不同成本的任务拆给不同模型

GPT-5.6 现在比较明显的特点,就是模型分层。

目前主要可以看三个档位:

  • GPT-5.6 Sol

  • GPT-5.6 Terra

  • GPT-5.6 Luna

GPT-5.6 Sol

截至 2026 年 8 月 26 日,Sol 的阶段性 API 价格为:

项目价格 / 100万 Token
输入$4
缓存输入$0.40
输出$20

这轮价格至少持续到 2026 年 11 月 21 日。相比之前的 $5 输入、$30 输出,输入价格下降 20%,输出下降约 33%。

Sol还是偏复杂任务。

例如:

  • 高难度推理

  • 大型代码项目

  • 复杂Agent

  • 专业知识工作

  • 多工具协同

如果只是做分类、摘要,直接全程跑Sol,通常没太大必要。

GPT-5.6 Terra

Terra现在是:

项目价格
输入$2 / 100万 Token
缓存输入$0.20
输出$12 / 100万 Token

OpenAI把它定位成兼顾能力和成本的型号,更适合作为大量日常开发任务的默认模型。

GPT-5.6 Luna

Luna这次价格调整更明显:

项目价格
输入$0.20 / 100万 Token
缓存输入$0.02
输出$1.20 / 100万 Token

7 月 30 日之前,Luna还是 $1 输入、$6 输出,现在价格已经降了很多。

这类模型很适合:

分类
摘要
标签生成
简单信息提取
批量文本处理
基础自动化

100 万输入 Token 只需要 0.2 美元。

如果项目每天都要处理大量文本,这种价格差距很容易在账单上体现出来。

OpenAI现在的思路其实很好理解:

简单、大量任务 → Luna

日常开发、Agent → Terra

复杂、高价值任务 → Sol

相比“所有请求都扔给旗舰模型”,这种方式更适合真正跑生产项目。


二、Claude:Sonnet 5现在最有吸引力的是Coding和Agent

Anthropic这边,现在比较值得看的还是 Claude Sonnet 5

当前长期价格已经确定为:

项目价格
输入$2 / 100万 Token
输出$10 / 100万 Token

Sonnet 5刚发布时,这个价格原本只是首发优惠,计划之后恢复到 $3 / $15。

但 Anthropic 在 8 月 10 日更新了规则:

$2 / $10直接变成长期价格。

这个变化很重要。

因为Claude现在比较有优势的使用场景,本身就是Token消耗比较大的:

  • Claude Code

  • Coding Agent

  • 浏览器操作

  • 多工具调用

  • 长任务

  • 大型代码库分析

普通聊天可能就是:

用户问题
→
模型回答

Agent不是这样。

实际过程可能变成:

读取代码
→
分析
→
搜索文件
→
修改
→
运行测试
→
发现报错
→
继续修改
→
再次测试

一条用户指令,背后可能已经运行了很多轮模型。

Anthropic自己也把Sonnet 5定位为更偏Agent、Coding和专业工作的一代Sonnet。

所以它并不是在打“最低单价”。

更像是在抢:

复杂Coding和Agent任务里的单位任务成本。

还有更贵的Claude Opus 5,目前是:

  • 输入:$5 / 100万 Token

  • 输出:$25 / 100万 Token

更适合对复杂代码、长时间Agent和高价值任务有更高要求的场景。


三、Gemini:Flash系列正在把价格压得很低

Google这边最近的变化也很快。

8月最新的 Gemini 3.7 Flash,以及3.6 Flash,目前都采用阶段性价格:

项目2026年底前2027年起
输入$0.75$1.50
输出$3.75$7.50
缓存输入$0.075$0.15

当前价格持续到 2026 年 12 月 31 日

这已经不是一个单纯“便宜的小模型”了。

Google现在把3.7 Flash明显往:

  • Coding

  • Agent

  • Web开发

  • 搜索与Grounding

  • 高频生产任务

这些方向推。

如果项目对模型能力要求不是最高档,但调用量特别大,这个价格就很有竞争力。

再往下还有:

Gemini 3.5 Flash-Lite

目前价格:

项目价格
输入$0.30 / 100万 Token
输出$2.50 / 100万 Token
缓存输入$0.03

Google对它的定位本身就是高调用量Agent、翻译和简单数据处理。

所以如果做的是:

大量翻译
文本分类
结构化提取
数据清洗
内容审核
简单Agent任务

Gemini这一档确实很容易把平均成本压下来。


四、把几家的价格放在一起看

以目前比较有代表性的型号为例:

模型输入 / 100万Token输出 / 100万Token更适合
GPT-5.6 Sol$4$20高难度推理、复杂专业任务
GPT-5.6 Terra$2$12日常开发、Agent、通用任务
GPT-5.6 Luna$0.20$1.20大批量低成本任务
Claude Sonnet 5$2$10Coding、Agent、复杂执行
Claude Opus 5$5$25高难度编程、长任务
Gemini 3.7 / 3.6 Flash$0.75$3.75高频调用、Agent、通用任务
Gemini 3.5 Flash-Lite$0.30$2.50翻译、分类、简单处理

注:以上为截至2026年8月26日官方公布的标准或阶段性价格。缓存、Batch、长上下文、Fast/Priority、搜索Grounding和其他工具可能另外计费,实际项目应以调用时官方Pricing页面为准。

只看这张表,很容易得出一个结论:

Gemini和GPT-5.6 Luna的Token成本已经压得很低。

但这还不能直接证明:

Gemini一定最省钱,或者Luna一定性价比最高。

原因是API真正应该算的不是Token单价,而是完成一次任务的成本


五、API成本不能只看每百万Token多少钱

假设现在有两个模型:

模型A:
每次任务 $0.01
成功率高

模型B:
每次任务 $0.006
但经常要重试

如果B平均执行两次才能得到满意结果:

$0.006 × 2 = $0.012

最终反而比A贵。

Agent场景尤其明显。

一次任务可能包含:

模型推理
+
重新读取上下文
+
搜索
+
工具调用
+
代码执行
+
失败重试
+
最终输出

这时候真正值得统计的是:

Cost per Task

也就是:

完成一个完整任务平均花多少钱。

而不是:

100万Token多少钱。

这个指标对于实际项目更有参考价值。


六、输出Token往往比输入更值得控制

看前面的价格表也能发现一个规律:

输出普遍比输入贵。

比如GPT-5.6 Terra:

输入:$2
输出:$12

Claude Sonnet 5:

输入:$2
输出:$10

GPT-5.6 Sol:

输入:$4
输出:$20

所以做大量:

  • 长报告

  • 长代码

  • 商品内容

  • 自动报告

  • Agent执行总结

时,不要只花时间缩短Prompt。

限制无意义输出通常更有效。

例如本来只是需要:

{
  "category": "refund"
}

就没有必要让模型再解释500字:

“根据您提供的信息,我认为该用户的主要诉求……”

生产系统和Chat界面的设计思路不应该完全一样。


七、实际项目更适合做模型分层

现在三个平台都有不同价格层级以后,我反而不建议项目只绑定一个模型。

可以按照任务复杂程度路由。

例如:

用户请求
   ↓
判断任务类型
   ↓
简单任务 → 低成本模型
普通任务 → 中档模型
复杂任务 → 高能力模型

具体可以是:

批量处理

优先测试:

  • GPT-5.6 Luna

  • Gemini Flash-Lite

普通开发和自动化

可以比较:

  • GPT-5.6 Terra

  • Claude Sonnet 5

  • Gemini 3.7 Flash

高价值复杂任务

再考虑:

  • GPT-5.6 Sol

  • Claude Opus 5

这里没有固定答案。

最好拿自己的真实数据做A/B测试。

例如记录:

任务成功率
平均Token
平均重试次数
平均响应时间
单任务实际成本
人工返工时间

跑一段时间以后,哪一个更划算基本就能看出来。


八、模型越来越便宜,为什么API账单反而可能增加?

这个现象现在已经越来越明显。

原因并不复杂。

以前:

用户请求一次
→
AI回答一次

现在:

用户给Agent一个任务
↓
Agent自己规划
↓
连续调用模型
↓
搜索网页
↓
读取文件
↓
调用工具
↓
运行代码
↓
失败重试
↓
继续执行

单次Token价格降了,但每个任务消耗的Token数量增加了

模型便宜以后,开发者也更愿意把AI塞进更多业务流程。

最终可能出现:

单价下降 50%

调用量增加 300%

总账单还是会上涨。

所以到了Agent阶段,API成本管理的重要性其实比过去更高。


九、多平台同时测试时,账单最好拆开管理

现在很多开发团队并不会只使用一家API。

很常见的是:

OpenAI
+
Claude
+
Gemini
+
其他AI开发服务

研发阶段可能这个模型跑Coding,另一个负责批量处理,再用第三个模型做Fallback。

如果API、AI Coding工具和海外SaaS全部使用同一个付款方式,后期做费用归属会比较麻烦。

比较清晰的思路是:

模型A → 独立项目预算
模型B → 独立项目预算
测试环境 → 较低额度
生产环境 → 单独管理

付款层也可以采用类似逻辑。

如果本身使用MXK8这类虚拟卡方案,可以按AI平台或项目分卡,并设置相应额度,用于区分不同服务的支出。

虚拟卡在这里更适合作为付款和费用归集工具,而不是API预算系统的替代品。

实际绑定前仍要确认:

  • 平台当前接受的卡片类型;

  • 发卡地区;

  • Billing Address;

  • 是否涉及周期性扣款;

  • API平台当前支付规则。

最终预算控制还是建议同时结合平台自身的Usage Limit、项目限额和代码侧调用限制。


十、现在到底谁的API最划算?

如果非要给一个非常简化的答案:

大批量低成本文本任务

可以重点测试:

GPT-5.6 Luna、Gemini 3.5 Flash-Lite。

Coding和Agent

目前:

Claude Sonnet 5、GPT-5.6 Terra、Gemini 3.7 Flash都值得实际跑一次自己的任务。

其中Sonnet 5目前的 $2 / $10 定价,对Coding和Agent场景比较有竞争力。

高难度专业任务

更适合比较:

GPT-5.6 Sol和Claude Opus 5。

价格更高,但这类任务真正应该看的不是一次调用贵几分钱,而是模型能不能一次完成。


写在最后

这一轮API价格变化,我觉得真正值得关注的不是:

OpenAI、Claude、Gemini到底谁便宜几毛钱。

而是整个大模型市场正在进入一个新的阶段。

过去主要比:

谁的模型更强

现在开始同时比:

谁能以更低成本
稳定完成真实任务

OpenAI在做模型分层;

Anthropic把Sonnet 5的优惠价格直接改成长期价格;

Google则继续用Flash系列压低大规模调用成本。

对开发者来说,这其实是好事。

现在没必要先站队。

拿自己的业务数据跑一遍,统计成功率、Token、重试次数和单任务成本

最后谁便宜,账单会比Benchmark告诉你得更清楚。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐