如果你还在用 2025 年初那套「Claude 写文、GPT 写码、Gemini 多模态」的刻板印象选模型——可以扔掉了

2026 年 7 月这一波更新,把格局彻底打乱:
Anthropic 一口气推出 Claude Opus 5 / Mythos 5 / Fable 5 / Sonnet 5;OpenAI 端出 GPT-5.6 Sol;国内与开源阵营则有 Kimi K3、DeepSeek V4、GLM 5.2 正面硬刚闭源旗舰。

本文只讲三件事:现在榜上谁靠前、不同场景怎么选、钱怎么花。


一、先看「总智力」

1. Humanity’s Last Exam(HLE)

排名 模型 HLE 分数 阵营
1 Claude Opus 5 64.7% Anthropic 闭源
2 Claude Mythos 5 64.5% Anthropic 闭源
3 Claude Opus 4.8 57.9% Anthropic 闭源
4 Claude Sonnet 5 57.4% Anthropic 闭源
5 Kimi K3 56% 开源权重
6 GLM 5.2 54.7% 开源/国内
7 Kimi K2.6 54%
8 DeepSeek V4 Flash 51.6% 开源
9 DeepSeek V4 Pro 48.2% 开源
10 GPT-5.6 Sol 47.2% OpenAI 闭源

结论:
综合「知识 + 难推理」,Claude 家族几乎包圆前四;开源里 Kimi K3 已摸到闭源二线;GPT-5.6 Sol 在这个总榜上不占优——它把火力集中在 coding / agent。

2. Artificial Analysis Intelligence Index

  • Claude Opus 5(Max)61 分,#1
  • GPT-5.6 Sol(max)59 分 前后
  • Kimi K357 分,开源权重第一梯队

高智力不等于便宜。Opus 5 Max 单次跑完评测大约是 $3800 量级的 token 成本——旗舰就是旗舰价。


二、按场景拆:别只看总分

1. 写代码 / 改仓库(SWE-Bench 等)

模型 大致水平 备注
GPT-5.6 Sol 96.2% agentic coding 王者
Claude Mythos 5 95.5% 紧咬
Claude Fable 5 95% 计算机使用也很强
GPT-5.6 Luna 93% 更偏性价比
Claude Opus 4.8 88.6% 上一代仍能打
  • 重度 Cursor / 类 Devin 工作流 → GPT-5.6 SolClaude Mythos / Fable 5
  • 预算敏感要质量 → Claude Sonnet 5
  • 想自托管 → Kimi K3 / DeepSeek V4

2. 终端 / 运维(Terminal-Bench)

模型 分数
GPT-5.6 Sol 88.8%
Kimi K3 88.3%
Claude Mythos 5 88%
Claude Fable 5 84.3%

开源 Kimi K3 在终端 agent 上已和闭源旗舰同档,做 NAS、脚本编排的可以认真评估。

3. 浏览器使用(BrowseComp)

模型 分数
GPT-5.6 Sol 92.2%
Kimi K3 91.2%
Claude Opus 5 90.8%
Claude Fable 5 88%

4. 电脑操作 / GUI Agent(OSWorld)

模型 分数
Claude Fable 5 85%
Claude Opus 4.8 83.4%
Claude Sonnet 5 81.2%
GPT-5.5 78.7%

真要点鼠标、开软件,Fable 5 目前更尖。

5. 办公自动化(AutoBench)

模型 分数
Claude Opus 5 26%(相对领先)
GPT-5.6 Sol 18.1%
Claude Fable 5 17.4%

长链路知识工作,Opus 5 优势明显。

6. 科学推理(GPQA Diamond)

顶部分数已到 94%+:Sonnet 5 约 96.2%,很多时候不必上 Opus。


三、钱:旗舰很贵,Flash 才是日用主力

模型 Input / 1M Output / 1M 定位
Claude Opus 5 ~$5 ~$25 旗舰知识工作
Claude Mythos 5 ~$10 ~$50 更贵顶配
Claude Sonnet 5 ~$3 ~$15 日常闭源主力
GPT-5.6 Sol ~$5 ~$30 旗舰 coding / agent
Kimi K3 ~$3 ~$15 开源权重,API 仍不便宜
Gemini Flash 系 / 小模型 更低 更低 速度与成本优先
  • 旗舰推理往往偏慢(Opus 5 Max 约 55 t/s,Kimi K3 约 32 t/s)
  • 主流旗舰上下文多在 1M 量级

榜和价目再漂亮,手感还是要自己摸。正式开户前,不妨先拿真实任务跑一轮。若暂时没有官方 Key,也可以去 jiurelay.com 领个限时接口,把 Cursor 或 Claude Code 先接通试一下,再决定为哪个模型买单。


四、怎么选:三套配方

配方 A:个人 / 小团队

用途 推荐
日常写作、总结 Claude Sonnet 5
重推理、长方案 Claude Opus 5(按需高 effort)
写代码、改 bug GPT-5.6 Sol 或 Claude Fable / Mythos 5
批量、便宜、快 Gemini Flash 系 / 小模型路由
数据不出域 / 可自建 Kimi K3 + DeepSeek V4

配方 B:要做 Agent 的产品团队

  1. Planner / 知识工作 → Opus 5
  2. Coder / Terminal → GPT-5.6 Sol 或 Kimi K3
  3. Browser / Computer Use → Sol + Fable 5
  4. 高 QPS 轻任务 → Flash / Haiku / nano 路由
  5. 用「每任务成本」算账,别只看每百万 token 单价

配方 C:预算极紧

  • API:DeepSeek V4 Flash、Gemini Flash-Lite、各家 nano
  • 权重:Kimi K3、GLM 5.2、Llama 4 系
  • 本地小模型只适合草稿和分类,别指望打 HLE 60%

五、容易踩的坑

  1. 别只信厂商自家榜——以独立评测和难卷为准。
  2. 「第一」是分场景的——总智力强 ≠ coding 一定最强。
  3. Reasoning / Max Effort 又贵又慢——生产要做档位和超时。
  4. 开源 ≠ 免费——大激活量模型的显存和工程成本很高。
  5. 多模态、语音另算——本文主谈文本与 agent。

六、一句话总结

2026 年中:Claude 系(尤其 Opus 5)拿下综合智力与知识工作;GPT-5.6 Sol 主攻 coding 与浏览器 agent;Kimi K3 把开源拉进第一梯队;日常别全开旗舰——Sonnet 5 + Flash 路由才是省钱真相。


数据截至 2026-07-28,榜单迭代很快;落地前再刷一遍独立评测。选模型没有「永远第一」,只有「此刻最适合你的那块」。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐