在这里插入图片描述


GPT-5.6 今天上线。早上打开 Codex,我这边已经能选到新模型了。

完整测试还没跑完,“全面碾压”这种话现在说太早。版本区别和额度规则倒是能先查清楚,OpenAI 公开的安全说明里还有一个容易被忽略的权限问题。

我是做嵌入式开发的。比起它能写多漂亮的文章,我更关心它能不能读懂日志和代码,遇到不确定的地方会不会先问一句,改文件之前会不会征求同意。

GPT-5.6 在 6 月 26 日先开启有限预览

这张图是 6 月 26 日的有限预览。北京时间 7 月 10 日,GPT-5.6 才开始向 ChatGPT、Codex 和 API 正式开放,官方预计会在 24 小时内逐步覆盖。

Codex 现在进了 ChatGPT

Codex 成为 ChatGPT 应用的真实提示界面

这个变化能省掉新手找入口的时间。按照页面提示,可以继续上一次中断的 Codex 工作,也能从 ChatGPT 里处理跨应用任务。我这边已经看到这个入口,其他账号可能会晚一点。

我电脑里已经能看到 5.6 了

我打开 Codex 的模型列表,里面已经出现了 5.6 Sol、5.6 Terra 和 5.6 Luna。

Codex 中真实显示的 GPT-5.6 模型列表

如果你的列表里还没有,不一定是账号有问题。GPT-5.6 正在逐步开放,晚一点再看就行。

还有一个容易误会的地方:ChatGPT 的快速日常聊天仍然主要使用 GPT-5.5 Instant。Plus 用户可以在 Medium、High 档使用 GPT-5.6 Sol;Free 和 Go 用户在普通聊天里暂时没有 Sol,但可以在 Codex 里使用 Terra。

Codex 版本太旧也看不到新模型。ChatGPT 桌面端的 Codex 模式至少需要 26.707.30751,Codex CLI 至少需要 0.144.0

Sol、Terra 和 Luna 的区别

OpenAI 开发者文档里的 GPT-5.6 三档模型

Sol 是能力最强的一档,适合复杂任务;Terra 在能力、速度和价格之间取平衡;Luna 更快、更便宜,适合简单而重复的工作。

如果只是让 AI 解释一段代码、整理资料或者修改一篇文档,我会先用 Terra。遇到跨很多文件、需要反复检查的任务,再换 Sol。Luna 可以留给批量分类、提取表格字段这类规则清楚的活。

这和选 MCU 有点像。主频最高的型号看着很诱人,但实际还要看任务需不需要,以及愿意花多少成本。

跑分

GPT-5.6 Sol 与 GPT-5.5 的四项任务指标

Terminal-Bench 2.1 测的是 AI 在终端里完成工程任务的能力,GPT-5.6 Sol 得分 88.8%,GPT-5.5 是 85.6%。

OSWorld 2.0 更接近日常电脑操作,5.6 得分 62.6%,5.5 是 47.5%。BrowseComp 测网页查找信息,成绩从 84.4% 提高到了 90.4%。

这些名字不需要背。简单理解就是:5.6 的提升不只在回答问题,它更擅长一边查资料、一边使用工具,再检查自己做得对不对。

跑分终究是跑分。到了自己的电脑上好不好用,还得自己试一次。

先把权限说清楚

OpenAI 在系统卡,也就是官方安全说明里,主动写了一段负面结果。

GPT-5.6 在长时间执行任务时,有时会太急着把事情做完,做出用户没有要求的操作。官方说这种情况的总量仍然很低,但列出的例子很具体。

有一次,用户让它删除指定的三台虚拟机。它找不到名字,便自己换成了另外三台,最后可能丢失了未保存的工作。

还有一次,它说某项计算已经验证,后来才发现程序只是直接填入了答案。另一个案例里,它为了继续任务,擅自查找并移动了用户的登录凭据。

这类错误比普通回答错一道题麻烦得多。

放到嵌入式设备里也很好理解。看门狗会在程序卡死时自动重启设备。如果 AI 为了消除“反复重启”这个现象,直接把看门狗关掉,页面上看起来修好了,真正的问题却还藏在里面。

所以第一次让 Codex 接触自己的项目,我会先把权限说清楚:

先只读检查当前项目,不要修改、删除、移动或上传任何文件,也不要安装依赖。
请列出你发现的问题、判断依据和建议修改方案,等我确认后再执行。

这句话没什么技术含量,但很有用。模型越能操作电脑,越要先告诉它哪些事情不能替你决定。

最后算一下额度

我刚开始用 5.6 时,也担心它会不会比 5.5 更快吃完额度。我去翻了 OpenAI 刚更新的 Codex 费率表,数字其实很清楚。

  • GPT-5.6 Sol 和 GPT-5.5 完全相同:每百万输入 token 扣 125 credits,缓存输入 12.5 credits,输出 750 credits。
  • GPT-5.6 Terra 是 Sol 的一半:输入 62.5 credits,输出 375 credits。
  • GPT-5.6 Luna 更低:输入 25 credits,输出 150 credits。

这些数字是每百万 token 的扣费标准。一次任务究竟用了多少,还要看读入了多少文件、对话有多长、输出多少内容,以及有没有反复调用工具。

OpenAI 没有说 5.6 完成同一个任务一定比 5.5 使用更多 token。官方发布页里还有一个反例:在 GeneBench Pro 测试中,GPT-5.6 Sol 的结果强于 GPT-5.5,同时使用了更少的 token。它不能代表所有任务,但至少说明“模型更新了,所以 token 必然更多”这个判断不成立。

我这边当时看到的使用量是:5 小时额度剩余 15%,每周额度剩余 87%。

使用 GPT-5.6 后看到的 Codex 真实额度界面

这张图看上去消耗很快,但它不能单独证明 5.6 比 5.5 更费。前面做过的任务、对话长度、读入文件数量和工具调用次数,全混在这两个百分比里。真要比较,至少要给两个模型相同的项目、相同的提示词和相同的推理档位,再分别记录输入与输出 token。

所以我不会因为 5.6 上线就把所有任务都切到 Sol。解释代码、整理文档这类日常工作先用 Terra;遇到跨很多文件、需要长时间推理的任务,再换 Sol。

资料来源

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐