7月25号,Claude官方发布了Opus 5。才两天时间,官宣帖子的浏览量就超过了2200万,点赞6.1万,成了近期X平台上讨论度最高的话题之一。

官方这次给Opus 5的定位很直白:用Fable 5一半的价格,给你接近它顶尖水平的能力。定价延续了Opus 4.8的标准,对所有付费套餐和API开放,还带了一个Fast模式,速度大概是普通模式的2.5倍。

不是价格炸场,是“直接能跑的东西”炸场

   不过真正让Opus 5在X上炸开锅的,不是价格,而是一批能直接“看见结果”的实测作品。

开发者Matt Shumer展示了一个由Opus 5一次性生成的游戏,画面、交互、程序逻辑全用定制代码写完,没引用任何外部素材。相关帖子浏览量超336万,点赞6800。

另一位叫Lentils的开发者更绝,让Opus 5在一个HTML文件里生成了个程序化生成的世界,里边几百万片草叶会跟着风场实时摆动。

这些案例共同指向了一个挺明显的变化:AI编程的展示单位,正从“一段代码”变成“一个完整的作品”。

过去评判模型好不好,老看它能不能写对函数、通过测试;现在大家更在乎它能不能一口气把游戏、网站、三维场景甚至一套能交付的产品原型给整出来。

自打模型能力突破这个临界点之后,我身边不少程序员的感觉都很一致: 以前用AI是“帮我写个函数”,现在是“帮 我把这个想法做出来”。你更像一个产品经理或架构师,把需求、目标和边界条件讲明白,剩下的它去跑。工作重心真就从抠细节变成了定方向、验收结果,写代码本身的时间被挤得越来越靠后了。

提示词正在变短,这是个信号

这次围绕Opus 5的第二个热点,是提示词正在变短。

Thariq发了个帖,浏览量快400万,点赞1.5万,收藏3.1万。帖子里说他们团队为了新一代Claude模型,把Claude Code的系统提示词砍掉了大约80%。更强的模型不再需要你反反复复告诉它“先规划”“检查结果”“调用子任务”或者“别半道停在那儿”。

这背后其实是一套新的用法在成形:与其用一大堆规则去锁死模型的每一步,不如把目标、上下文、限制条件和验收标准讲清楚,然后让它自个儿安排执行过程。

以前在老模型上攒下来的那些又长又密的提示词,现在喂给Opus 5,反而容易让它过度检查、重复调用工具,白白烧掉更多时间和Token。

也不是一边倒地叫好

当然,X上的声音也不是一边倒地叫好。Claude官方说Opus 5在很多编程和知识工作评测里冲到了新的顶尖水平,还特意提了一嘴,在一个叫ARC-AGI-3的测试上(主要测解决陌生问题的能力),它的成绩是第二名的三倍。

但也有一些开发者在复杂的代码仓库里试过之后说,Opus 5虽然明显比4.8强,稳定性可能还是不如Fable 5。

还有用户分享,头一回用Opus 5觉得它速度慢、出来的东西也平平无奇,后来调整了任务结构和提示方式,表现才一下子上来了。这说明Opus 5不是一个能把随便什么烂提示词都“点石成金”的模型。 它更像是那种能力很强、成本也相对可控,但需要你把任务交代清楚的执行者。

容易被忽略的安全那面

安全性是讨论里比较容易被人忽略的一角。Claude官方表示,Opus 5在自动化行为审计里,欺骗和鲁莽行为的比例更低。在网络安全任务上,它比4.8要强,但在开发攻击工具方面还是明显不如更高级的Mythos 5,并且对高风险用途加了限制。

刷屏之后,什么更值得看

综合目前这些讨论来看,Opus 5不单是把模型排行榜的位次往前拱了一格。它更重要的意义,是把接近顶尖模型的能力带到了一个更多人用得起的价位,同时推着AI从“协助写代码”走向“自主交付作品”。

接下来真正值得观察的,不是它还能刷多少榜,而是在那些持续几小时甚至几天的复杂任务里,它到底能不能一直保持正确、稳定和可控。

当模型已经能一次生成游戏、主动调用工具、自己检查结果的时候,人干活的重心也会跟着变:少写操作指令,多定义目标;少盯着每一步输出,多设计验收标准。

我会在oken.ai上持续的记录Opus5在各个API调用平台上的稳定性,可以做个参考哦Oken.ai

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐