2026 年中大模型横评:谁才是你真正该用的「大脑」?
如果你还在用 2025 年初那套「Claude 写文、GPT 写码、Gemini 多模态」的刻板印象选模型——可以扔掉了。
2026 年 7 月这一波更新,把格局彻底打乱:
Anthropic 一口气推出 Claude Opus 5 / Mythos 5 / Fable 5 / Sonnet 5;OpenAI 端出 GPT-5.6 Sol;国内与开源阵营则有 Kimi K3、DeepSeek V4、GLM 5.2 正面硬刚闭源旗舰。
本文只讲三件事:现在榜上谁靠前、不同场景怎么选、钱怎么花。
一、先看「总智力」
1. Humanity’s Last Exam(HLE)
| 排名 | 模型 | HLE 分数 | 阵营 |
|---|---|---|---|
| 1 | Claude Opus 5 | 64.7% | Anthropic 闭源 |
| 2 | Claude Mythos 5 | 64.5% | Anthropic 闭源 |
| 3 | Claude Opus 4.8 | 57.9% | Anthropic 闭源 |
| 4 | Claude Sonnet 5 | 57.4% | Anthropic 闭源 |
| 5 | Kimi K3 | 56% | 开源权重 |
| 6 | GLM 5.2 | 54.7% | 开源/国内 |
| 7 | Kimi K2.6 | 54% | — |
| 8 | DeepSeek V4 Flash | 51.6% | 开源 |
| 9 | DeepSeek V4 Pro | 48.2% | 开源 |
| 10 | GPT-5.6 Sol | 47.2% | OpenAI 闭源 |
结论:
综合「知识 + 难推理」,Claude 家族几乎包圆前四;开源里 Kimi K3 已摸到闭源二线;GPT-5.6 Sol 在这个总榜上不占优——它把火力集中在 coding / agent。
2. Artificial Analysis Intelligence Index
- Claude Opus 5(Max):61 分,#1
- GPT-5.6 Sol(max):59 分 前后
- Kimi K3:57 分,开源权重第一梯队
高智力不等于便宜。Opus 5 Max 单次跑完评测大约是 $3800 量级的 token 成本——旗舰就是旗舰价。
二、按场景拆:别只看总分
1. 写代码 / 改仓库(SWE-Bench 等)
| 模型 | 大致水平 | 备注 |
|---|---|---|
| GPT-5.6 Sol | 96.2% | agentic coding 王者 |
| Claude Mythos 5 | 95.5% | 紧咬 |
| Claude Fable 5 | 95% | 计算机使用也很强 |
| GPT-5.6 Luna | 93% | 更偏性价比 |
| Claude Opus 4.8 | 88.6% | 上一代仍能打 |
- 重度 Cursor / 类 Devin 工作流 → GPT-5.6 Sol 或 Claude Mythos / Fable 5
- 预算敏感要质量 → Claude Sonnet 5
- 想自托管 → Kimi K3 / DeepSeek V4
2. 终端 / 运维(Terminal-Bench)
| 模型 | 分数 |
|---|---|
| GPT-5.6 Sol | 88.8% |
| Kimi K3 | 88.3% |
| Claude Mythos 5 | 88% |
| Claude Fable 5 | 84.3% |
开源 Kimi K3 在终端 agent 上已和闭源旗舰同档,做 NAS、脚本编排的可以认真评估。
3. 浏览器使用(BrowseComp)
| 模型 | 分数 |
|---|---|
| GPT-5.6 Sol | 92.2% |
| Kimi K3 | 91.2% |
| Claude Opus 5 | 90.8% |
| Claude Fable 5 | 88% |
4. 电脑操作 / GUI Agent(OSWorld)
| 模型 | 分数 |
|---|---|
| Claude Fable 5 | 85% |
| Claude Opus 4.8 | 83.4% |
| Claude Sonnet 5 | 81.2% |
| GPT-5.5 | 78.7% |
真要点鼠标、开软件,Fable 5 目前更尖。
5. 办公自动化(AutoBench)
| 模型 | 分数 |
|---|---|
| Claude Opus 5 | 26%(相对领先) |
| GPT-5.6 Sol | 18.1% |
| Claude Fable 5 | 17.4% |
长链路知识工作,Opus 5 优势明显。
6. 科学推理(GPQA Diamond)
顶部分数已到 94%+:Sonnet 5 约 96.2%,很多时候不必上 Opus。
三、钱:旗舰很贵,Flash 才是日用主力
| 模型 | Input / 1M | Output / 1M | 定位 |
|---|---|---|---|
| Claude Opus 5 | ~$5 | ~$25 | 旗舰知识工作 |
| Claude Mythos 5 | ~$10 | ~$50 | 更贵顶配 |
| Claude Sonnet 5 | ~$3 | ~$15 | 日常闭源主力 |
| GPT-5.6 Sol | ~$5 | ~$30 | 旗舰 coding / agent |
| Kimi K3 | ~$3 | ~$15 | 开源权重,API 仍不便宜 |
| Gemini Flash 系 / 小模型 | 更低 | 更低 | 速度与成本优先 |
- 旗舰推理往往偏慢(Opus 5 Max 约 55 t/s,Kimi K3 约 32 t/s)
- 主流旗舰上下文多在 1M 量级
榜和价目再漂亮,手感还是要自己摸。正式开户前,不妨先拿真实任务跑一轮。若暂时没有官方 Key,也可以去 jiurelay.com 领个限时接口,把 Cursor 或 Claude Code 先接通试一下,再决定为哪个模型买单。
四、怎么选:三套配方
配方 A:个人 / 小团队
| 用途 | 推荐 |
|---|---|
| 日常写作、总结 | Claude Sonnet 5 |
| 重推理、长方案 | Claude Opus 5(按需高 effort) |
| 写代码、改 bug | GPT-5.6 Sol 或 Claude Fable / Mythos 5 |
| 批量、便宜、快 | Gemini Flash 系 / 小模型路由 |
| 数据不出域 / 可自建 | Kimi K3 + DeepSeek V4 |
配方 B:要做 Agent 的产品团队
- Planner / 知识工作 → Opus 5
- Coder / Terminal → GPT-5.6 Sol 或 Kimi K3
- Browser / Computer Use → Sol + Fable 5
- 高 QPS 轻任务 → Flash / Haiku / nano 路由
- 用「每任务成本」算账,别只看每百万 token 单价
配方 C:预算极紧
- API:DeepSeek V4 Flash、Gemini Flash-Lite、各家 nano
- 权重:Kimi K3、GLM 5.2、Llama 4 系
- 本地小模型只适合草稿和分类,别指望打 HLE 60%
五、容易踩的坑
- 别只信厂商自家榜——以独立评测和难卷为准。
- 「第一」是分场景的——总智力强 ≠ coding 一定最强。
- Reasoning / Max Effort 又贵又慢——生产要做档位和超时。
- 开源 ≠ 免费——大激活量模型的显存和工程成本很高。
- 多模态、语音另算——本文主谈文本与 agent。
六、一句话总结
2026 年中:Claude 系(尤其 Opus 5)拿下综合智力与知识工作;GPT-5.6 Sol 主攻 coding 与浏览器 agent;Kimi K3 把开源拉进第一梯队;日常别全开旗舰——Sonnet 5 + Flash 路由才是省钱真相。
数据截至 2026-07-28,榜单迭代很快;落地前再刷一遍独立评测。选模型没有「永远第一」,只有「此刻最适合你的那块」。
更多推荐



所有评论(0)