这次更新表面看是“加量不加价”,实际上是把 AI 编程的门槛直接锯断了一半。

核心变化有两点:

  1. 价格未变,性能跃升:新模型性能逼近内部旗舰,但定价与上一代保持一致(输入 $5 / 百万 token)。以前舍不得经常调用的顶级模型,现在可以当日常主力用了。

  2. 自主性显著增强:在硬核测试中,面对“不给看图权限,重建 3D 模型”这种刁难题,同类模型大多无法完成,而新模型能现场构建一套计算机视觉算法,从原始像素中提取数据。这说明它不再被动等待指令,而是具备了“缺啥补啥”的主动解决问题的能力

随之而来的不仅是账单惊吓,还有“性格”上的差异。

从实际体感来看,Opus 5 虽然智商提升了,但“话痨”的本色依旧。即便设定为无人值守模式,它在排查 Bug 时依然会一边查一边输出大量过程性废话,文风与 Opus 4.8 一脉相承。相比之下,内部旗舰 Fable 5 则显得更加老练:收到指令后全程静默,只调用工具,直到最后直接交付原因和修复方案,仅在涉及业务设计的分歧点才会停下来询问倾向。

这种差异决定了二者的分工:主会话交互适合 Fable 5,而 Opus 5 更适合作为高性价比的执行单元。​ 但当 Opus 5 开启“自验证闭环”(自己跑测试、自己改错)时,调用频次将呈指数级上升,加上它爱“碎碎念”的习惯,Token 消耗极有可能失控。

这也引出了工程治理的新课题。通过 Routescope 这样的统一 AI 模型聚合与分发网关,团队可以实施更精细的调度策略。利用其智能路由功能,可以根据任务类型自动分流:将需要安静执行的后台排查任务分配给 Opus 5,将对交互质量要求极高的主会话留给 Fable 5,同时在非核心环节自动调度性价比更高的模型。这种基于模型“性格”与能力的差异化管控,通常能为团队节省 20-40% 的实际支出,避免高昂的 Token 消耗击穿预算。

此外,Claude 的“手脚”也在变长。

配合此次发布,桌面端开始测试直接驱动 iOS 模拟器。以往 AI 写完代码,需人工启动模拟器验证效果;现在它能自主运行 App,并根据屏幕反馈修正布局。值得一提的是,它并未采用“接管鼠标键盘”的传统方式,无需申请屏幕录制权限,而是独立开辟面板运行,不影响用户处理其他事务。

还有一个值得关注的逆向调整:

官方将底层代码的系统提示词缩减了 80%,编码能力却未见下滑。这是否意味着,随着模型能力的提升,过去为“防呆”而堆砌的繁琐规则,如今反而成了制约其发挥的累赘?

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐