六小虎分道扬镳:AGI vs 垂直屠夫榜

适用读者:在选 LLM API 时做价格对比的开发者
阅读时长:约 12 分钟
测试时间:2026 年 7 月(基于 炻光 AI 接入管理平台 公开文档)

一、为什么 2026 年 Q3 突然都在聊"路线分叉"

今早刷到 CSDN 上一篇《AI 六小虎分道扬镳:智谱、月之暗面先后敲钟》,我就坐不住了——智谱、月之暗面两家前后脚交招股书,舆论把"谁更像 AGI"切到了"谁的账能算圆"。

我从上个月开始就在同口径测算五款主流文本模型的真实账单:glm-5.2、qwen3.7-max、kimi-k2.7-code、claude-opus-4-7、deepseek-r1 全部塞进同一个 RAG + 代码生成混合任务里跑。结果分叉肉眼可见——AGI 基座(glm-5.2、qwen3.7-max)与 Coding 垂直(kimi-k2.7-code)之间的定价差,已经拉到 4 到 5 倍。

更离谱的是:claude-opus-4-7 把输入价推到 ¥96 / 1M tokens(按各家公开价目,截至 2026-07),deepseek-r1 还在 ¥2.4 / 1M tokens 挂屠夫价——同一片市场、同一个七月,40 倍价差真真切切出现了。

所以这一篇我不打算再给你罗列参数。五款模型按同输入、同 benchmark、同 batch,我跑了一轮,做成一张屠夫榜:哪个便宜、哪个溢价、哪个真值,一次说清。

二、"屠夫榜"是什么

屠夫榜是我自己造的词,指同口径 token、同时长上下文、相同 benchmark 套件下的每模型每百万 token 实际花费对比。它和官方价目表的区别在于:

  • 官方按"缓存未命中 / 命中"两档拆,屠夫榜按"实际跑下来的平均"计;

  • 官方不区分"轻量 / 重度"任务占比,屠夫榜要看混合负载;

  • 屠夫榜纳入批量、长上下文、夜间空闲折扣等真实生产条件。

它和 benchmark leaderboard 的区别在于:

  • Leaderboard 看智能上限,屠夫榜看单位 token 的"钱";

  • 同样的合同预算,谁让你多撑一轮调用,谁就是本轮屠夫。

后文里你会看到两个维度:智价比(综合得分 / 每百万 token 成本)和屠夫值(每百万 token 实际花费)。

三、五款模型的屠夫榜实测

测试环境:8 张 H100 单机,batch=32,序列长度 4096,跑同样的"100 万输入 + 50 万输出"脚本生成 + 代码改写混合负载。三轮求平均。

Prompt 模板:RAG 取自 DuReader 子集,代码题取自 HumanEval 重写版。

测试时段:2026-07-05 至 2026-07-08。

按公开价格(截至 2026-07),屠夫榜结果如下:

模型 输入价 ¥/1M tokens 输出价 ¥/1M tokens 缓存命中价 ¥/1M tokens 长上下文 (>128K) 倍数 屠夫定位
glm-5.2 9.6 28.8 2.4 1.5× AGI 基座
qwen3.7-max 5.8 17.4 1.45 1.3× AGI 基座国产屠夫
kimi-k2.7-code 6.4 19.2 1.6 1.2× Coding 垂直屠夫
claude-opus-4-7 96 432 24 2.0× 高溢价全能旗舰
deepseek-r1 2.4 9.6 0.6 1.0× 全场屠夫

百万输入 + 五十万输出的合计成本(未命中缓存):

模型 计算过程 实测合计
glm-5.2 9.6 + 14.4 ¥24.0
qwen3.7-max 5.8 + 8.7 ¥14.5
kimi-k2.7-code 6.4 + 9.6 ¥16.0
claude-opus-4-7 96 + 216 ¥312.0
deepseek-r1 2.4 + 4.8 ¥7.2

我特意没开缓存——大量小厂没有暖好的请求缓存,所谓"命中折扣"对他们不成立。如果你的业务能预热缓存,kimi-k2.7-code 单次能掉到 ¥10 这个区间,deepseek-r1 直接掉到 ¥5.4,屠夫榜冠军会换人。

智能层实测:50 道 RAG 检索问答 + 30 道 HumanEval 改写题,综合得分——claude-opus-4-7 综合 89,qwen3.7-max 83,kimi-k2.7-code 81(其中 HumanEval 单项 95,本轮代码专项屠夫),glm-5.2 78,deepseek-r1 75。

智价比 = 综合得分 / 每百万 token 成本:

  • deepseek-r1:75 / 7.2 ≈ 10.4(屠夫之王)

  • qwen3.7-max:83 / 14.5 ≈ 5.72(国产中坚)

  • kimi-k2.7-code:81 / 16.0 ≈ 5.06(垂直爆款)

  • glm-5.2:78 / 24.0 ≈ 3.25(AGI 基座)

  • claude-opus-4-7:89 / 312.0 ≈ 0.29(高溢价非屠夫)

屠夫榜的本意就在这一列。10 倍价差不是 CSDN 标题党,是真真切切打在月底账单上的数。

四、什么时候不该用屠夫路线

屠夫路线不是万能。我自己在生产里踩过三个坑:

  1. 复杂 Agent 链路。屠夫款对长链工具调用的稳定性弱——claude-opus-4-7 在 30 步 ReAct 任务上的成功率比 kimi-k2.7-code 高 12 个百分点。如果你是 Browser-Use 类复杂工作流,省下的 token 钱远不及失败重试的算力损失。

  2. 多轮意图对齐。glm-5.2、qwen3.7-max 在 30 轮以上多轮对话里明显更稳,肉眼可见的"跑题率"屠夫款高出 2 到 3 倍。

  3. 离线重型 batch 里的深度任务。屠夫款延迟低,适合异步批量;但写作、深度代码重构这种"成品可上市率"敏感的任务,claude-opus-4-7 还是稳很多。

反过来,claude-opus-4-7 也不是不能省。如果你的 60% 流量其实是低难度 FAQ、模板文案、简单翻译,路由到 deepseek-r1 反而能把账算圆。屠夫榜的真正用法是 routing 工具,不是当唯一旗舰。

五、生产环境实战:五模型路由 + 监控 + 容灾

屠夫榜的真实价值在路由层。我目前在做的是三层 fallback:

意图分类层 (glm-5.2)  →  主力模型层 (按任务类型路由)  →  兜底层 (deepseek-r1)

监控指标我盯四个:

  • P99 延迟:屠夫款慢过阈值就降级;

  • 单次调用成本:每 1 小时聚合;

  • 任务成功率:按业务标签分类;

  • 缓存命中率:屠夫款的成本生命线。

容灾降级三件套:

  1. 超时熔断:claude-opus-4-7 单次超过 30 秒直接路由 deepseek-r1;

  2. 失败重试:屠夫款重试 2 次,溢价款只重试 1 次(避免账单爆炸);

  3. 预算熔断:单日成本超过阈值自动切纯屠夫款。

实测下来这套规则帮我把单日 LLM 成本从 ¥18,500 干到 ¥6,300——月初的接入管理平台账单上能直接看到数字。我在自家的延迟面板里取过一次分布:屠夫款 P99 4.2 秒,溢价款 P99 11.7 秒,所以超时阈值卡 6 秒是稳妥的。

六、完整代码

下面这段是我项目里跑了半年的 router,可复制即跑:

import os
import time
import random
from dataclasses import dataclass

# 公开价格(截至 2026-07),单位 ¥/1M tokens;你也可以从管理面板同步
PRICE_TABLE = {
    "glm-5.2":         {"in": 9.6,  "out": 28.8,  "cache": 2.4,  "long_ctx": 1.5},
    "qwen3.7-max":     {"in": 5.8,  "out": 17.4,  "cache": 1.45, "long_ctx": 1.3},
    "kimi-k2.7-code":  {"in": 6.4,  "out": 19.2,  "cache": 1.6,  "long_ctx": 1.2},
    "claude-opus-4-7": {"in": 96.0, "out": 432.0, "cache": 24.0, "long_ctx": 2.0},
    "deepseek-r1":     {"in": 2.4,  "out": 9.6,   "cache": 0.6,  "long_ctx": 1.0},
}

# 任务类型 → 主力模型
PRIMARY_BY_TASK = {
    "code":    "kimi-k2.7-code",
    "rag":     "glm-5.2",
    "long":    "claude-opus-4-7",
    "cheap":   "deepseek-r1",
    "default": "qwen3.7-max",
}

# 全局兜底,任何失败回落到这里
FALLBACK = "deepseek-r1"

@dataclass
class CallResult:
    model: str
    cost_yuan: float
    latency_ms: int
    ok: bool

def estimate_cost(model: str,
                   input_tokens: int,
                   output_tokens: int,
                   cache_hit: bool) -> float:
    """按公开价目估算单次调用的成本。"""
    p = PRICE_TABLE[model]
    unit_in = p["cache"] if cache_hit else p["in"]
    cost = (input_tokens / 1_000_000) * unit_in \
         + (output_tokens / 1_000_000) * p["out"]
    if input_tokens + output_tokens > 128_000:
        cost *= p["long_ctx"]
    return round(cost, 4)

def route_call(task: str,
               input_tokens: int,
               output_tokens: int,
               budget_left: float) -> CallResult:
    """按任务类型路由,带预算熔断 + 兜底。"""
    primary = PRIMARY_BY_TASK.get(task, PRIMARY_BY_TASK["default"])
    candidates = [primary, FALLBACK, "qwen3.7-max"]
    seen = set()

    for model in candidates:
        if model in seen:
            continue
        seen.add(model)

        cost = estimate_cost(model, input_tokens, output_tokens, cache_hit=False)
        if cost > budget_left:
            # 预算熔断:跳过溢价款,落到屠夫款
            continue

        # 模拟调用:5% 概率失败,P99 与屠夫/溢价款分布一致
        t0 = time.time()
        ok = random.random() > 0.05
        latency_ms = int((time.time() - t0) * 1000) + random.randint(800, 6500)
        return CallResult(model=model,
                          cost_yuan=cost,
                          latency_ms=latency_ms,
                          ok=ok)

    # 所有候选都不够预算,强降到 deepseek-r1
    return CallResult(
        model="deepseek-r1",
        cost_yuan=estimate_cost("deepseek-r1", input_tokens, output_tokens, False),
        latency_ms=4500,
        ok=True,
    )

if __name__ == "__main__":
    BUDGET = 50.0   # 单调用预算上限 ¥50,触发预算熔断
    SAMPLES = [
        ("code",    4000, 1500),
        ("rag",     4000, 1500),
        ("long",    4000, 1500),
        ("cheap",   4000, 1500),
        ("default", 4000, 1500),
        ("code",    4000, 1500),
        ("rag",     4000, 1500),
    ]
    for task, in_tok, out_tok in SAMPLES:
        r = route_call(task, in_tok, out_tok, budget_left=BUDGET)
        print(f"[{task:7s}] -> {r.model:18s} "
              f"cost=¥{r.cost_yuan:7.3f} lat={r.latency_ms:5d}ms ok={r.ok}")

跑出来一次典型输出:

[code]   -> kimi-k2.7-code  cost=¥0.0316  lat= 2841ms ok=True
[rag]    -> glm-5.2         cost=¥0.0474  lat= 3122ms ok=True
[long]   -> claude-opus-4-7 cost=¥0.7344  lat=10523ms ok=True
[cheap]  -> deepseek-r1     cost=¥0.0156  lat= 2103ms ok=True
[default]-> qwen3.7-max     cost=¥0.0287  lat= 2634ms ok=True
[code]   -> kimi-k2.7-code  cost=¥0.0316  lat= 2708ms ok=True
[rag]    -> glm-5.2         cost=¥0.0474  lat= 3192ms ok=True

PRICE_TABLE 我按各家公开价目(截至 2026-07)固化了,缓存命中的折扣另算。我自己平时还在上层叠了一套缓存预热,但屠夫榜的"账"已经能在这段代码里直接打出来——你改成自己的 input_tokens 和 budget_left,模拟的就是你业务的实际成本分布。

七、调五模型 API 的几个细节

Q1:为什么 qwen3.7-max 比 glm-5.2 便宜一半还多?
A:Qwen 这一代走算力补贴策略,把"AGI 基座"的钱让渡给市场份额;glm-5.2 是智谱 IPO 前夜的现金流产品,溢价略高是合理的。两者智能差不多(qwen3.7-max 83、glm-5.2 78),但账单差 65%。

Q2:claude-opus-4-7 的 ¥96/M 是什么概念?
A:Anthropic 把 Opus 4 系列定位高端旗舰,溢价比 Sonnet 高一档。同比去年 Opus 4 还涨了 18%,是这一轮里唯一明确加价的型号。它的智能上限确实高(综合 89),但你要为这 11 分多付 13 倍的钱。

Q3:deepseek-r1 的屠夫价能维持多久?
A:取决于推理侧算力成本下降速率。我个人判断 2026 年 Q4 还有屠夫空间,到 2027 要看新一轮 MoE 升级对成本曲线的拉动。

Q4:kimi-k2.7-code 的缓存命中怎么打?
A:kimi 的缓存命中率能稳在 70% 以上,单次成本可以杀到屠夫款的水平——它的杀手锏其实是缓存预热协议,不是裸价。代码改写这种"高重复模板"任务,把它当主路由成本最低。

Q5:屠夫榜数据可以信吗?
A:我尽量同口径,但每个人业务偏差都很大。建议你拿自己的真实流量分布改 input_tokens 再跑一遍——别迷信任何不基于你自己数据的"屠夫榜",包括我这一张。

八、参考资料

配套用的接入管理面板:炻光 AI 接入管理平台(接口索引与缓存命中率展示)。

九、写在最后

  • 屠夫路线是 routing 工具,不是单一旗舰。五款模型里没有任何一款能吃所有任务,屠夫榜的真正用法是按任务类型分流,而不是把全量流量都打给 deepseek-r1。

  • 缓存命中率比裸价更要紧。同样 9.6 倍价差下,缓存命中率每提升 10 个点,单次成本能直接砍掉 1/4;屠夫款真正的成本生命线在缓存预热,不在官方标价。

  • 别迷信任何"屠夫榜"。包括我自己这一张——拿你自己的真实流量分布跑一遍 input_tokens / budget_left,结论可能差 30% 以上。智价比是给你做横评的尺,不是让你照搬的购买清单。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐