Codex到底该选哪个模型?
我是 Plus 用户,平时在 Codex 里用得最多的是 Sol medium。
理由很简单:它能力强,我不太需要担心选错。可额度不够用以后,这套办法就有点撑不住了。明明只是改几个文件,我也开 Sol;需求已经写得很清楚,还是开 Sol。很多时候并非任务离不开它,只是我懒得在开始前多想一步。
看完评论区,我发现大家的用法大致分成三种:无脑 Sol;让 Sol 出方案、Luna 执行;日常开发用 Terra,把 Sol 留给真正难的部分。
我现在更倾向于第三种。但这里有个问题必须先说清楚:什么才算“真正难”?
01 一个简单问题,也可能变成复杂任务
如果目标明确、操作过程明确,任务一般不会太难。比如把一个字段改名,用户已经告诉我改哪里、改成什么,也有测试可以检查。
但“目标不清楚”本身不等于复杂。有时只是少问了一句话。“帮我把页面改好看一点”很模糊,补充参考图、目标用户和验收标准以后,可能马上就能做。
我更在意的是执行过程中会冒出多少意外。
拿批量处理文件来说,规则不难,数量一多,事情就会变味。1000 份文件哪怕只有 1% 不符合模板,也有大约 10 个例外。接下来还会碰到重复数据、处理中断、失败重试,以及怎么确认没有漏掉。单个动作很简单,整批交付却不轻松。
所以我判断任务时,会看四件事:目标清不清楚、过程里要做多少判断、规模会不会放大异常、做错以后返工有多贵。
02 我现在怎么选
放到我自己的任务里,大概是下面这样:
|
当前任务 |
我会先用 |
什么时候升级 |
|---|---|---|
|
需求没想清、约束互相冲突、要做方案取舍 |
Sol medium |
多步依赖很深或返工昂贵时升 high |
|
需求基本明确,日常写代码、改代码 |
Terra |
连续失败或出现跨模块判断时换 Sol |
|
规则固定、数量大、可以自动验收 |
Luna |
出现模板外异常时交回 Terra 或 Sol |
|
只想尽快做出可运行原型 |
Luna 或 Terra |
准备上线、补测试和处理边界时再升级 |
推理档位我也不再默认拉满。Medium 先跑,确实遇到多步推理、冲突约束或高风险交付,再升 high。xhigh 和 max 留给那些“多花额度确实能少返工”的任务。
如果模型选择器里还有 GPT-5.5、GPT-5.4,可以继续留给已经验证稳定的旧项目;GPT-5.4 mini 更适合成本敏感、结果容易检查的小任务。OpenAI 当前模型目录里出现的模型,不一定会同时开放给每个 Plus 用户,还是要以自己在 Codex 里实际看到的选项为准。

03 那张成本图,其实是在提醒我们别把档位拉满
这张 Artificial Analysis 的图,横轴是完成一项 Intelligence Index 基准任务的平均 API 成本,纵轴是综合智能指数。

OpenAI 的 GPT-5.6 模型指南把 Sol 定位为最高能力,Terra 平衡能力与成本,Luna 面向高效率和大批量工作。图里的分布也差不多:Luna 集中在左边,Sol 一路往右上走,Terra 夹在中间。
综合基准测不到我在 Codex 里真正关心的全部东西,比如响应速度、工具调用、长任务稳定性,以及失败后要不要我手动收拾。图里的 API 成本也不等于 Plus 额度。
我从图里拿走的结论只有一个:同一个模型从 high 升到 xhigh、max,能力还会涨,但 token 用得更多。真正的成本还包括等待、重试、人工修改和返工。便宜模型连续做错三次,未必便宜;一个只需要做到“能用”的任务,也没必要开 Sol max 去追最后那几分。
04 一次整本翻译,让我开始盯着交付看
我测试过把整本《爱丽丝梦游仙境》翻译成中文,再生成 PDF。
这个需求看上去很清楚:提取正文、逐章翻译、重新排版、导出文件。Luna medium 跑了 5 分多钟,最后真的生成了一份 185 页 PDF。问题是,只有封面和目录变成了中文,正文还是英文。

看到文件出现的那一刻,我还以为任务结束了。打开以后才发现,它只是“产出了东西”。
这种任务难的地方不在某一句英文会不会翻,而在几十个章节能不能全部走完,过程中有没有跳过内容,导出的 PDF 能不能验收。后来我给这类任务加了分章处理和程序检查,专门查章节数、残留英文与空白页。
05 两个编程任务,让我换了两次标准
另一次测试是做猫咪偷鱼小游戏。Luna 很快给出一个能玩的版本:猫咪可以移动、偷鱼、躲开障碍,再跑回猫窝。画面谈不上精致,但我马上就能试玩,也知道下一轮该改什么。

还有一个 3D 魔方,Luna 用了 19 分 12 秒,两个核心测试通过,页面可以直接运行。

如果我当时只是验证玩法和交互,这两个结果都够用。原型阶段最怕的不是少两个测试,而是每次改动都要等很久,等到最后连自己刚才想验证什么都忘了。
准备上线时,猫咪小游戏要补关卡状态、边界条件和自动化测试;3D 魔方也要确认打乱与还原逻辑,甚至做随机压力测试。
06 模型路由 Skill,好像真可以做
写到这里,我前面那个跑题的想法反而越来越像回事:做一个模型路由 Skill。它读取前面那几个判断条件,只给三样东西:推荐模型、推理档位、升级条件。模型发布新版本时,替换路由表就行,不用推翻整个工作方法。
我接下来大概会真的做一个,先拿自己的任务试。
更多推荐





所有评论(0)