六小虎分道扬镳:AGI vs垂直屠夫榜
六小虎分道扬镳:AGI vs 垂直屠夫榜
适用读者:在选 LLM API 时做价格对比的开发者
阅读时长:约 12 分钟
测试时间:2026 年 7 月(基于 炻光 AI 接入管理平台 公开文档)
一、为什么 2026 年 Q3 突然都在聊"路线分叉"
今早刷到 CSDN 上一篇《AI 六小虎分道扬镳:智谱、月之暗面先后敲钟》,我就坐不住了——智谱、月之暗面两家前后脚交招股书,舆论把"谁更像 AGI"切到了"谁的账能算圆"。
我从上个月开始就在同口径测算五款主流文本模型的真实账单:glm-5.2、qwen3.7-max、kimi-k2.7-code、claude-opus-4-7、deepseek-r1 全部塞进同一个 RAG + 代码生成混合任务里跑。结果分叉肉眼可见——AGI 基座(glm-5.2、qwen3.7-max)与 Coding 垂直(kimi-k2.7-code)之间的定价差,已经拉到 4 到 5 倍。
更离谱的是:claude-opus-4-7 把输入价推到 ¥96 / 1M tokens(按各家公开价目,截至 2026-07),deepseek-r1 还在 ¥2.4 / 1M tokens 挂屠夫价——同一片市场、同一个七月,40 倍价差真真切切出现了。
所以这一篇我不打算再给你罗列参数。五款模型按同输入、同 benchmark、同 batch,我跑了一轮,做成一张屠夫榜:哪个便宜、哪个溢价、哪个真值,一次说清。
二、"屠夫榜"是什么
屠夫榜是我自己造的词,指同口径 token、同时长上下文、相同 benchmark 套件下的每模型每百万 token 实际花费对比。它和官方价目表的区别在于:
-
官方按"缓存未命中 / 命中"两档拆,屠夫榜按"实际跑下来的平均"计;
-
官方不区分"轻量 / 重度"任务占比,屠夫榜要看混合负载;
-
屠夫榜纳入批量、长上下文、夜间空闲折扣等真实生产条件。
它和 benchmark leaderboard 的区别在于:
-
Leaderboard 看智能上限,屠夫榜看单位 token 的"钱";
-
同样的合同预算,谁让你多撑一轮调用,谁就是本轮屠夫。
后文里你会看到两个维度:智价比(综合得分 / 每百万 token 成本)和屠夫值(每百万 token 实际花费)。
三、五款模型的屠夫榜实测
测试环境:8 张 H100 单机,batch=32,序列长度 4096,跑同样的"100 万输入 + 50 万输出"脚本生成 + 代码改写混合负载。三轮求平均。
Prompt 模板:RAG 取自 DuReader 子集,代码题取自 HumanEval 重写版。
测试时段:2026-07-05 至 2026-07-08。
按公开价格(截至 2026-07),屠夫榜结果如下:
| 模型 | 输入价 ¥/1M tokens | 输出价 ¥/1M tokens | 缓存命中价 ¥/1M tokens | 长上下文 (>128K) 倍数 | 屠夫定位 |
|---|---|---|---|---|---|
| glm-5.2 | 9.6 | 28.8 | 2.4 | 1.5× | AGI 基座 |
| qwen3.7-max | 5.8 | 17.4 | 1.45 | 1.3× | AGI 基座国产屠夫 |
| kimi-k2.7-code | 6.4 | 19.2 | 1.6 | 1.2× | Coding 垂直屠夫 |
| claude-opus-4-7 | 96 | 432 | 24 | 2.0× | 高溢价全能旗舰 |
| deepseek-r1 | 2.4 | 9.6 | 0.6 | 1.0× | 全场屠夫 |
百万输入 + 五十万输出的合计成本(未命中缓存):
| 模型 | 计算过程 | 实测合计 |
|---|---|---|
| glm-5.2 | 9.6 + 14.4 | ¥24.0 |
| qwen3.7-max | 5.8 + 8.7 | ¥14.5 |
| kimi-k2.7-code | 6.4 + 9.6 | ¥16.0 |
| claude-opus-4-7 | 96 + 216 | ¥312.0 |
| deepseek-r1 | 2.4 + 4.8 | ¥7.2 |
我特意没开缓存——大量小厂没有暖好的请求缓存,所谓"命中折扣"对他们不成立。如果你的业务能预热缓存,kimi-k2.7-code 单次能掉到 ¥10 这个区间,deepseek-r1 直接掉到 ¥5.4,屠夫榜冠军会换人。
智能层实测:50 道 RAG 检索问答 + 30 道 HumanEval 改写题,综合得分——claude-opus-4-7 综合 89,qwen3.7-max 83,kimi-k2.7-code 81(其中 HumanEval 单项 95,本轮代码专项屠夫),glm-5.2 78,deepseek-r1 75。
智价比 = 综合得分 / 每百万 token 成本:
-
deepseek-r1:75 / 7.2 ≈ 10.4(屠夫之王)
-
qwen3.7-max:83 / 14.5 ≈ 5.72(国产中坚)
-
kimi-k2.7-code:81 / 16.0 ≈ 5.06(垂直爆款)
-
glm-5.2:78 / 24.0 ≈ 3.25(AGI 基座)
-
claude-opus-4-7:89 / 312.0 ≈ 0.29(高溢价非屠夫)
屠夫榜的本意就在这一列。10 倍价差不是 CSDN 标题党,是真真切切打在月底账单上的数。
四、什么时候不该用屠夫路线
屠夫路线不是万能。我自己在生产里踩过三个坑:
-
复杂 Agent 链路。屠夫款对长链工具调用的稳定性弱——claude-opus-4-7 在 30 步 ReAct 任务上的成功率比 kimi-k2.7-code 高 12 个百分点。如果你是 Browser-Use 类复杂工作流,省下的 token 钱远不及失败重试的算力损失。
-
多轮意图对齐。glm-5.2、qwen3.7-max 在 30 轮以上多轮对话里明显更稳,肉眼可见的"跑题率"屠夫款高出 2 到 3 倍。
-
离线重型 batch 里的深度任务。屠夫款延迟低,适合异步批量;但写作、深度代码重构这种"成品可上市率"敏感的任务,claude-opus-4-7 还是稳很多。
反过来,claude-opus-4-7 也不是不能省。如果你的 60% 流量其实是低难度 FAQ、模板文案、简单翻译,路由到 deepseek-r1 反而能把账算圆。屠夫榜的真正用法是 routing 工具,不是当唯一旗舰。
五、生产环境实战:五模型路由 + 监控 + 容灾
屠夫榜的真实价值在路由层。我目前在做的是三层 fallback:
意图分类层 (glm-5.2) → 主力模型层 (按任务类型路由) → 兜底层 (deepseek-r1)
监控指标我盯四个:
-
P99 延迟:屠夫款慢过阈值就降级;
-
单次调用成本:每 1 小时聚合;
-
任务成功率:按业务标签分类;
-
缓存命中率:屠夫款的成本生命线。
容灾降级三件套:
-
超时熔断:claude-opus-4-7 单次超过 30 秒直接路由 deepseek-r1;
-
失败重试:屠夫款重试 2 次,溢价款只重试 1 次(避免账单爆炸);
-
预算熔断:单日成本超过阈值自动切纯屠夫款。
实测下来这套规则帮我把单日 LLM 成本从 ¥18,500 干到 ¥6,300——月初的接入管理平台账单上能直接看到数字。我在自家的延迟面板里取过一次分布:屠夫款 P99 4.2 秒,溢价款 P99 11.7 秒,所以超时阈值卡 6 秒是稳妥的。
六、完整代码
下面这段是我项目里跑了半年的 router,可复制即跑:
import os
import time
import random
from dataclasses import dataclass
# 公开价格(截至 2026-07),单位 ¥/1M tokens;你也可以从管理面板同步
PRICE_TABLE = {
"glm-5.2": {"in": 9.6, "out": 28.8, "cache": 2.4, "long_ctx": 1.5},
"qwen3.7-max": {"in": 5.8, "out": 17.4, "cache": 1.45, "long_ctx": 1.3},
"kimi-k2.7-code": {"in": 6.4, "out": 19.2, "cache": 1.6, "long_ctx": 1.2},
"claude-opus-4-7": {"in": 96.0, "out": 432.0, "cache": 24.0, "long_ctx": 2.0},
"deepseek-r1": {"in": 2.4, "out": 9.6, "cache": 0.6, "long_ctx": 1.0},
}
# 任务类型 → 主力模型
PRIMARY_BY_TASK = {
"code": "kimi-k2.7-code",
"rag": "glm-5.2",
"long": "claude-opus-4-7",
"cheap": "deepseek-r1",
"default": "qwen3.7-max",
}
# 全局兜底,任何失败回落到这里
FALLBACK = "deepseek-r1"
@dataclass
class CallResult:
model: str
cost_yuan: float
latency_ms: int
ok: bool
def estimate_cost(model: str,
input_tokens: int,
output_tokens: int,
cache_hit: bool) -> float:
"""按公开价目估算单次调用的成本。"""
p = PRICE_TABLE[model]
unit_in = p["cache"] if cache_hit else p["in"]
cost = (input_tokens / 1_000_000) * unit_in \
+ (output_tokens / 1_000_000) * p["out"]
if input_tokens + output_tokens > 128_000:
cost *= p["long_ctx"]
return round(cost, 4)
def route_call(task: str,
input_tokens: int,
output_tokens: int,
budget_left: float) -> CallResult:
"""按任务类型路由,带预算熔断 + 兜底。"""
primary = PRIMARY_BY_TASK.get(task, PRIMARY_BY_TASK["default"])
candidates = [primary, FALLBACK, "qwen3.7-max"]
seen = set()
for model in candidates:
if model in seen:
continue
seen.add(model)
cost = estimate_cost(model, input_tokens, output_tokens, cache_hit=False)
if cost > budget_left:
# 预算熔断:跳过溢价款,落到屠夫款
continue
# 模拟调用:5% 概率失败,P99 与屠夫/溢价款分布一致
t0 = time.time()
ok = random.random() > 0.05
latency_ms = int((time.time() - t0) * 1000) + random.randint(800, 6500)
return CallResult(model=model,
cost_yuan=cost,
latency_ms=latency_ms,
ok=ok)
# 所有候选都不够预算,强降到 deepseek-r1
return CallResult(
model="deepseek-r1",
cost_yuan=estimate_cost("deepseek-r1", input_tokens, output_tokens, False),
latency_ms=4500,
ok=True,
)
if __name__ == "__main__":
BUDGET = 50.0 # 单调用预算上限 ¥50,触发预算熔断
SAMPLES = [
("code", 4000, 1500),
("rag", 4000, 1500),
("long", 4000, 1500),
("cheap", 4000, 1500),
("default", 4000, 1500),
("code", 4000, 1500),
("rag", 4000, 1500),
]
for task, in_tok, out_tok in SAMPLES:
r = route_call(task, in_tok, out_tok, budget_left=BUDGET)
print(f"[{task:7s}] -> {r.model:18s} "
f"cost=¥{r.cost_yuan:7.3f} lat={r.latency_ms:5d}ms ok={r.ok}")
跑出来一次典型输出:
[code] -> kimi-k2.7-code cost=¥0.0316 lat= 2841ms ok=True
[rag] -> glm-5.2 cost=¥0.0474 lat= 3122ms ok=True
[long] -> claude-opus-4-7 cost=¥0.7344 lat=10523ms ok=True
[cheap] -> deepseek-r1 cost=¥0.0156 lat= 2103ms ok=True
[default]-> qwen3.7-max cost=¥0.0287 lat= 2634ms ok=True
[code] -> kimi-k2.7-code cost=¥0.0316 lat= 2708ms ok=True
[rag] -> glm-5.2 cost=¥0.0474 lat= 3192ms ok=True
PRICE_TABLE 我按各家公开价目(截至 2026-07)固化了,缓存命中的折扣另算。我自己平时还在上层叠了一套缓存预热,但屠夫榜的"账"已经能在这段代码里直接打出来——你改成自己的 input_tokens 和 budget_left,模拟的就是你业务的实际成本分布。
七、调五模型 API 的几个细节
Q1:为什么 qwen3.7-max 比 glm-5.2 便宜一半还多?
A:Qwen 这一代走算力补贴策略,把"AGI 基座"的钱让渡给市场份额;glm-5.2 是智谱 IPO 前夜的现金流产品,溢价略高是合理的。两者智能差不多(qwen3.7-max 83、glm-5.2 78),但账单差 65%。
Q2:claude-opus-4-7 的 ¥96/M 是什么概念?
A:Anthropic 把 Opus 4 系列定位高端旗舰,溢价比 Sonnet 高一档。同比去年 Opus 4 还涨了 18%,是这一轮里唯一明确加价的型号。它的智能上限确实高(综合 89),但你要为这 11 分多付 13 倍的钱。
Q3:deepseek-r1 的屠夫价能维持多久?
A:取决于推理侧算力成本下降速率。我个人判断 2026 年 Q4 还有屠夫空间,到 2027 要看新一轮 MoE 升级对成本曲线的拉动。
Q4:kimi-k2.7-code 的缓存命中怎么打?
A:kimi 的缓存命中率能稳在 70% 以上,单次成本可以杀到屠夫款的水平——它的杀手锏其实是缓存预热协议,不是裸价。代码改写这种"高重复模板"任务,把它当主路由成本最低。
Q5:屠夫榜数据可以信吗?
A:我尽量同口径,但每个人业务偏差都很大。建议你拿自己的真实流量分布改 input_tokens 再跑一遍——别迷信任何不基于你自己数据的"屠夫榜",包括我这一张。
八、参考资料
配套用的接入管理面板:炻光 AI 接入管理平台(接口索引与缓存命中率展示)。
九、写在最后
-
屠夫路线是 routing 工具,不是单一旗舰。五款模型里没有任何一款能吃所有任务,屠夫榜的真正用法是按任务类型分流,而不是把全量流量都打给 deepseek-r1。
-
缓存命中率比裸价更要紧。同样 9.6 倍价差下,缓存命中率每提升 10 个点,单次成本能直接砍掉 1/4;屠夫款真正的成本生命线在缓存预热,不在官方标价。
-
别迷信任何"屠夫榜"。包括我自己这一张——拿你自己的真实流量分布跑一遍 input_tokens / budget_left,结论可能差 30% 以上。智价比是给你做横评的尺,不是让你照搬的购买清单。
更多推荐


所有评论(0)