模块一"LLM 平台与模型"从第 1 期到第 9 期,测了 11 个模型/变体、3 个聚合平台,累计 400+ 次 API 调用,花了大约 $25 的测试经费。

这篇文章把所有的结论压缩成一张总表 + 一张决策图 + 六个场景推荐。你可以收藏,以后选模型时直接查。

如果这篇文章只读一段——读最后面的 “六个常见场景,我的推荐”


总表:所有模型 × 所有任务

以下数据全来自模块一 1-9 期实测(2026 年 5 月 22-24 日)。评分 /5,长上下文为 20 万字符文档中后段 (40-60%) 事实召回率。

模型 代码生成 Bug修复 Code Review 中文文档 长上下文 输出价格 $/M 速度 t/s
DeepSeek V4 Pro 4.6 4.5 4.0 4.5 60% 3.48 48
DeepSeek V4 Pro-Think 4.6 5.0 4.2 4.5 3.48 48
DeepSeek V4 Flash 3.4 3.0 3.0 3.2 0.28 35
GPT-4o 4.5 4.4 3.5 3.6 62% 10.00 62
Claude Sonnet 4 4.4 4.5 4.8 3.8 62% 15.00 55
Gemini 2.5 Pro 3.8 3.8 4.0 3.5 84% 免费* 265
Qwen-Max API 4.6 4.0 3.5 4.5 2.80 48
文心一言 4.0 Turbo 3.9 3.5 3.5 4.5 0.41 35
智谱 GLM-4-Plus 3.6 3.3 3.2 4.2 1.23 30
Kimi 3.2 4.0 78% 0.70 25
DeepSeek Coder V2 16B 本地 4.2 4.0 3.5 4.0 免费 15
Qwen-Coder-14B 本地 3.4 3.0 3.0 3.7 免费 18

* Gemini 2.5 Pro 通过 Google AI Studio 有免费额度(100次/天)。"—"表示未在此维度测试。本地模型速度取决于 GPU。


六个常见场景,我的推荐

场景 1:日常开发(写 CRUD、新功能、脚手架)

首选:DeepSeek V4 Pro
省钱:DeepSeek V4 Flash(质量打骨折)
英文项目:GPT-4o(CRUD 一步到位,少写很多代码)

DeepSeek V4 Pro 在代码生成和 Bug 修复两项分别拿了 4.6 和 4.5 分——都是最高或并列最高。价格在可接受范围($3.48/百万 token 输出),月成本大约 $2-3。

如果你的项目偏英文生态,GPT-4o 的 CRUD 代码"一步到位"——它给的代码结构更完整(model → repo → service → handler → middleware 五层都写好),DeepSeek 倾向于给更精简的实现。

场景 2:修 Bug / 线上排查

首选:DeepSeek V4 Pro-Think(唯一全找出的)
次选:Claude Sonnet 4 或 GPT-4o

这是唯一一个我会开"思考模式"的场景——架构分析和 Bug 修复。第 1 期的测试里,Pro-Think 是唯一能找全 4 个并发 Bug 的配置。第 3 期里,Claude 在 Bug 修复上跟 GPT-4o 打了平手(9:8),两者都靠谱。

如果你遇到的是安全相关的 Bug(SQL 注入、权限绕过),Gemini 2.5 Pro 是唯一的"做了安全影响分析"的模型——它不只说"这里有 SQL 注入",还会说"这个注入可被攻击者通过 X 方式利用"。

场景 3:Code Review

首选:Claude Sonnet 4
安全向:Gemini 2.5 Pro

Claude 在 Code Review 上的 4.8/5 是碾压级的——它按 Critical / Major / Minor / Suggestion 分级,每条给出了具体行号、原因、和修复代码。第 3 期的测试里,Claude 14 胜 vs GPT-4o 4 胜。

Gemini 2.5 Pro 的独特价值在安全方面——它是唯一会分析安全影响范围(“这个漏洞可被如何利用”)的模型。如果你的项目涉及支付、隐私、权限管理,建议 Claude Review 完再用 Gemini 做一次安全检查。

场景 4:写中文技术文档

首选:文心一言 4.0 Turbo(综合 4.5/5)
次选:DeepSeek V4 Pro(综合 4.5/5,代码更强)

第 5 期测试里,文心一言在 API 文档(4.4)、技术文章(4.1)、错误文案(4.3)、README(4.5)四个中文文档场景拿了第一。但它的代码生成(3.9)和 Bug 修复(3.5)不如 DeepSeek。

所以如果你的任务是"生成一篇纯中文技术文章"——用文心一言。如果任务是"写代码的同时生成中文文档"——用 DeepSeek V4 Pro,一步到位。

代码注释这个细分场景:智谱 GLM-4-Plus 拿了 4.25/5——唯一超过文心一言的。智谱写代码注释更"程序员视角",关键分支上给的行内注释有实际参考价值。

场景 5:长文档问答 / 读技术书

首选:Gemini 2.5 Pro(84% 召回率,免费)
超长文档(200K+):Kimi(128K 限制?实际可处理 200 万汉字)

第 4 期测了 Gemini 2.5 Pro(100 万 token 上下文),第 6 期测了 Kimi(200 万汉字上下文)。在 20 万字符的 PostgreSQL 文档测试中:

  • 文档中后段(40-60%)召回率:Gemini 80% ≈ Kimi 80%,两者相当
  • 文档尾部(60-80%)召回率:Kimi 70% > Gemini 落后但未在此区域单独测试
  • 最重要的差异:Gemini 在安全相关文档上会做"安全影响分析",Kimi 不会

实操建议:如果你需要精确查参数——Kimi。如果你需要读安全/合规文档并理解风险——Gemini 2.5 Pro。两者用同一个文档并行问更好。

一个重要发现(第 6 期):不管你用哪个模型,文档尾部 20% 的内容准确率都崩塌(最好只有 50%)。别一次性塞一本 20 万字的书——拆成 5 个片段分批提问。

场景 6:数据不能出内网 / 离线

首选(12GB 显存):DeepSeek Coder V2 16B (Q4)
次选(8GB):Qwen-Coder-7B (Q4)
没有显卡:别折腾,申请 API 白名单

第 2 期和第 7 期的本地部署测试一致显示:本地最强模型(DeepSeek Coder V2 16B)大约等于 API 版 DeepSeek V4 Pro 的 85% 水平。能接受这个差距,再考虑本地部署。

硬件要求参考(第 7 期):

  • 6-8GB 显存 → 只能跑 7-8B,代码质量一般
  • 12GB 显存 → 14-16B 刚好,别开其他 GPU 应用
  • 16-24GB 显存 → 本地部署开始有性价比

聚合平台选择(第 9 期结论)

你的情况 平台
国内、常用 DeepSeek + Qwen SiliconFlow(同价、快、开票)
用 3+ 不同厂商的模型 OpenRouter(唯一全接)
开源模型批量推理 DeepInfra(最便宜,但稳定性差)
只用 DeepSeek 官方直连(不走平台,省钱)

每月成本估算

按"一个普通程序员的日常使用量"估算(约 2000 次 API 调用/月,含代码生成、Bug 修复、文档生成、Code Review):

方案 配置 月成本
丐版 DeepSeek V4 Flash + Gemini 免费 < $1
标准 DeepSeek V4 Pro 为主 + Claude Review $3-5
顶配 GPT-4o + Claude + DeepSeek Pro-Think 全上 $15-20
零成本 Gemini 免费 + 本地模型 $0

我的推荐:标准方案,$3-5/月。 你少喝一杯咖啡就省出来了。


几点说明

1. 这些数据会过时。

模型 API 每周微调。这里的所有数据是 2026 年 5 月 22-24 日测的。你今天跑出来的数字可能不同——正常。

2. 关键不是我的数字,是测试方法。

前面每篇文章都附了测试 prompt 和方法。拿同一套 prompt 跑你自己的任务,才对你最有参考价值。

3. 没有"一个模型统治所有"。

第 8 期讲过了——每个维度都有一个最强的,但没有一个模型在所有维度拿第一。选模型是根据任务选,不是选信仰。


模块一下面是什么

模块一"LLM 平台与模型"到这里结束。10 篇文章,11 个模型,3 个平台,一张总表。


附录:模块一全部文章索引

期号 标题 核心发现
01 DeepSeek 全家桶评测 80% 的活用 Flash 够,Bug 修复必须 Pro-Think
02 通义千问实战手册 API 版比本地强 24%,12GB 显存别对本地抱太高期望
03 GPT-4o vs Claude 对决 CRUD 用 GPT-4o,Code Review 用 Claude
04 Gemini 程序员向评测 长上下文召回率 84%,代码生成不如 DeepSeek
05 文心一言 vs 智谱 GLM 中文文档文心领先,代码注释智谱意外能打
06 Kimi 长上下文实测 中间位置召回率比竞品高 20%,尾部准确率仍然崩塌
07 开源模型本地部署 本地最强 = API 85%,12GB 显存能跑但卡线
08 模型选型决策框架 三个维度 + 决策树 + 速查表
09 API 聚合平台对比 SiliconFlow 最便宜、OpenRouter 最全、DeepInfra 最不稳
10 本总结指南 总表 + 六场景推荐 + 成本估算
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐