一、为什么换模型

我日常用 Claude Code 写 Python 脚本、搭 Electron 客户端、维护 Obsidian 工作流。一开始只用官方 Claude,后来发现成本太高,就试了 Kimi、Agnes AI、GLM 这几个。

CC Switch 这个工具让我不用换 Claude Code 客户端,直接在界面里切换模型。今天把 4 个模型的真实体验摊开来讲。

4个AI模型实测对比


二、测试范围

我挑了 4 类真实任务,每个模型都跑一遍:

任务类型具体场景
代码调试PubHub 调度器 KeyError 修复
文档维护README 更新、frontmatter 规范检查
原型开发Web 管理后台多页原型骨架
日常问答解释工具用法、推荐配置

4类测试任务


三、官方 Claude(主力)

用时:每次会话 5-15 分钟
成本:高
成功率:~95%

官方 Claude 是我的主力,原因很简单:skill 生态完整、工具调用最稳、长上下文理解最强。

优势: - 工具调用成功率最高,Bash / Read / Edit 基本不翻车 - 长文档分析稳定,我的 Obsidian vault 有几十篇待发布文章,一口气读完没问题 - skill 支持最好,publish-workflow / article-writing 等 skill 依赖 Claude 的指令遵循能力

劣势: - 贵。每天跑大量会话,token 成本不容忽视 - 国内访问需要代理,偶尔不稳定

我的做法: 复杂任务(架构设计、多步调试)必用官方;简单任务换便宜的。


四、Kimi For Coding(k3-256k)

用时:每次会话 3-8 分钟
成本:中
成功率:~85%

Kimi 是我第二常用的模型。我的会话日志显示,它在技能包安装、README 更新、日常维护类任务上表现不错。

真实案例: 我用 Kimi 安装 ponytail skill 系列。任务是用 git clone 把仓库拉到 ~/.claude/skills/,然后更新 README 索引。Kimi 正确执行了 Bash 命令、读取了目录结构、编辑了文件,整个过程没有翻车。

优势: - 速度快,同样任务比官方 Claude 快 30-50% - 中文理解自然,不翻译腔 - 200K+ 上下文,适合长文档分析 - 国内直连,不需要代理

劣势: - 复杂多步调试偶尔出错,比如 PubHub 调度器的 KeyError 修复,Kimi 给的答案不够精准 - 工具调用偶尔"想太多",思考链过长导致超时 - 对 Claude 专属 skill 的遵循能力稍弱

适合场景: 文档维护、技能包管理、日常问答、简单代码修改。不适合复杂架构调试。


五、Agnes AI(agnes-2.0-flash)

用时:每次会话 2-6 分钟
成本:低
成功率:~75%

Agnes 是我做原型开发时的备选。会话日志显示,它在 2026-07 期间被大量用于原型和 specs 编写。

真实案例: 我用 Agnes 开发「图片管理空间」原型。它生成了 HTML 结构、CSS 样式、JavaScript 交互逻辑,基本能跑。但有几个小 bug 需要手动修。

优势: - 成本最低,适合大量试错 - 原型开发速度快,能快速出稿 - 中文表达自然

劣势: - 代码质量不稳定,偶有语法错误或逻辑 bug - 工具调用不如官方 Claude 精准,偶尔误判需求 - 对复杂指令的遵循能力较弱,多步任务容易跑偏

适合场景: 快速原型、UI 调试、一次性任务。不适合需要高可靠性的生产代码。


六、Zhipu GLM

用时:每次会话 2-5 分钟
成本:最低
成功率:~65%

GLM 是我最后的备选,主要用于成本敏感的场景。

优势: - 成本最低 - 中文理解强,适合文档类任务 - 国内直连

劣势: - 代码生成质量不稳定,复杂逻辑容易出错 - 工具调用能力弱,不适合多步骤任务 - 对 Claude 专属 skill 的遵循能力最弱

适合场景: 简单问答、文档整理、一次性调研。不适合编程任务。


七、对比总结

维度官方 ClaudeKimiAgnesGLM
编码准确率⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
中文理解⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
工具调用⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
速度⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
成本最低
适合复杂任务部分
适合日常维护
适合快速原型部分

八、我的模型选择策略

按任务选模型

根据任务类型选模型,不是随机换:

  1. 复杂编程/调试 → 官方 Claude(成功率优先)
  2. 文档维护/技能包管理 → Kimi(速度快成本低)
  3. 快速原型/UI 调试 → Agnes(成本低试错快)
  4. 简单问答/调研 → GLM(成本最低)

关键原则: 把贵的留给贵的任务,便宜的任务用便宜的模型。


九、下一步

接下来我会写两篇深度单测: - 《Kimi For Coding 实测:从技能包安装到 README 维护的完整体验》 - 《Agnes AI 实测:原型开发的性价比之选》

如果这篇对你有用,欢迎关注看「AI 工具人 PM 实战」系列更新;你平时用哪些 AI 模型写代码?评论聊聊;觉得有用就收藏备用。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐