AI开始“接活儿“了:GPT-5.6、Grok 4.5、Muse Spark集体亮牌,大模型进入“交付结果“时代
AI开始"接活儿"了:GPT-5.6、Grok 4.5、Muse Spark集体亮牌,大模型进入"交付结果"时代
2026年7月的第二周,OpenAI、xAI、Meta、Google几乎在同一时间亮出了新模型。
如果你只盯着跑分榜单上那几分增长,很可能会错过真正发生的事。这一波发布潮里,没有人在认真比"谁的模型更聪明"。OpenAI的GPT-5.6 Sol开始学会"指挥"一群子智能体;马斯克的Grok 4.5是第一个和代码编辑器Cursor一起训练出来的;Meta的Muse Spark 1.1第一次开始向开发者收费,而且定价直接砍到对手的四分之一。
一句话:大模型正在从"回答问题的人",变成"能接活儿、干完活儿、交付结果的人"。
上篇文章我们聊过,为什么56%的企业AI项目落不了地,问题不在模型够不够聪明,而在工程和编排。今天要讲的另一半:当模型侧能力这一波集体跃迁之后,落地难的"第二个答案"出现了——你真的可以把活儿交给它了。
这篇文章,我用这一周的真实发布和数据,讲清楚三件事:模型到底跨过了哪道门槛、商业模式正在怎么改写、以及这股变化对你我意味着什么。
一、从"回答问题"到"完成工作":一道被悄悄跨过的门槛
过去两年,大模型的进化主线是"如何更聪明地回答问题"。但2026年7月这一批新模型,主线变了。
OpenAI的GPT-5.6 Sol带了一个叫Ultra的模式,核心不是单次对话,而是"多智能体调度"。面对一个包含多步编码、测试、部署的软件工程需求,模型会自动把任务拆成子任务,启动多个子智能体并行处理,最后把结果汇总回来。在端到端编程测试Terminal-Bench 2.1上,Ultra模式拿了91.9分,比单模型标准模式高了3.1个百分点,同时长链路Agent任务的Token消耗反而比前代低了10%到15%。
这不是"一个人从头干到尾",而是"自动组建一个项目组":有人写代码,有人跑测试,有人查文档,有人做集成,最后汇总给项目经理。
xAI的Grok 4.5走得更极端。它是第一个专门针对编程和智能体任务、和Cursor联合训练的模型,参数规模1.5万亿,支持百万级代码库的长上下文读取和跨文件自主调试。最关键的是成本:单个任务消耗的Token只有同级领先模型的一半,每秒输出80个Token,单次任务步骤数也少一半,定价是每百万输入Token 2美元、输出6美元,成本不到同类可比模型的一半。
Google的选择则是"与其修补旧房子,不如推倒重建"。2026年7月发布的Gemini 3.5 Pro,不是Gemini 2.5的增量升级,而是放弃旧基座、从零开始全量重新预训练。原因是旧基座在前端代码、SVG矢量图生成、基础数学推理上存在代际级短板,增量微调已经补不齐了。重训之后,基础事实类问题的召回准确率比前代提升了30%以上。
这三家的动作看似不同,指向却同一个:AI的定位,正在从提供信息的"知识助手",转向执行任务的"数字劳动力"。
德勤2026年的企业AI调查说得很直白:66%的受访组织表示AI已经带来生产率收益,但只有25%的受访者成功把40%以上的AI试点项目推进到生产环境。这说明,阻碍AI商业化的最大瓶颈,早已不是"模型不够聪明",而是"模型难以稳定地嵌入企业工作流、自主把事干完"。
而现在,模型侧补上了这最后一块拼图。
二、商业模式的悄悄改写:从"卖聪明"到"卖结果"
模型能力到位之后,第一个被改写的,是厂商自己怎么赚钱。
Google在重组企业级AI产品线时,官方表述出现了一个微妙但关键的变化:平台重点从"管理单个AI任务",转向"委派业务结果",并支持长时Agent、持久记忆和权限治理。注意这两个词——"委派"和"结果"。过去你买的是"一个能聊天的工具",现在Google想卖的是"一个能替你扛下业务指标的系统"。
Meta的转向更剧烈。过去一年,扎克伯格一直坚持做免费开源模型;2026年7月,Muse Spark 1.1第一次开始向开发者收费,并推出Meta Model API平台。扎克伯格自己说,这是Meta"第一次真正认真推出API服务",定价"将会非常激进、非常有吸引力"——实际价格是OpenAI和Anthropic同类顶级模型的约四分之一。
从"免费开源"到"闭源收费",几乎等于重建一整套技术体系。为什么这么做?因为Meta想掌握底层模型,从而围绕"个人AI助手"这个核心场景塑造最佳体验。扎克伯格有一句话值得记住:"如果你真的想打造最好的用户体验,就必须能够塑造底层技术。"
微软的动作则从另一个方向印证了同一趋势。2026年7月初,微软开始在Excel、Outlook等主力办公App里,用自研的MAI模型替换OpenAI和Anthropic的模型,每周处理AI提示词达数万条量级。微软AI模型业务负责人的目标很明确:减少并最终消除支付给Anthropic等外部厂商的大笔费用。
把这三件事放在一起看,结论很清楚:当模型能交付闭环,收费的单位就从"Token"变成了"结果"。厂商不再只是出租算力,而是在出售"把事办成"的能力。
这对企业采购者意味着一件事:你评估AI供应商的标准,该换了。
三、推理成本正在坍塌:这是Agent能真正跑起来的前提
光有能力跃迁还不够。Agent要大规模进企业,必须跨过第二道坎:成本。
2026年7月这波发布,把"成本"这件事摊得很开。
OpenAI的GPT-5.6分了Sol、Terra、Luna三档:Terra是面向高吞吐业务的均衡型,价格比GPT-5.5便宜2倍,性能却有竞争力;Luna是 Everyday 最快最省的选项。xAI的Grok 4.5,如前所述,Token成本不到同类一半。DeepSeek把V4的推理加速方案(DSpark、DFlash、Eagle3三种主流方案)用MIT协议开源,线上真实流量实测,单用户生成速度提升60%到85%,任何厂商都能拿来就用。
更值得关注的是国产算力侧的突破。美团在2026年7月开源了万亿参数大模型LongCat-2.0,总参数1.6万亿,平均激活约480亿,是业界首个在五万张国产算力集群上完成全流程训练与推理的万亿参数模型,原生支持100万Token超长上下文,在SWE-bench Pro上得分59.5,领先Gemini 3.1 Pro和GPT-5.5。腾讯的混元Hy3也已经接入超过50个自家业务产品。
把这些拼起来,就是一句话:推理成本正在经历类似光伏和摩尔定律叠加式的坍塌。
这意味着什么?过去很多企业犹豫上Agent,理由是"跑一次太贵,不划算"。现在,成本线已经被压到"不用都对不起自己"的位置。
但我要提醒一句反直觉的话:成本坍塌,也意味着"用了AI"本身不再是差异化优势。当所有人都用得起顶级智能,"有没有用AI"不再是护城河,"怎么把活儿委派给AI、并让它稳定交付"才是。这正好接上了上篇文章的结论——工程能力和编排能力,才是下一阶段的真壁垒。成本把门撞开了,但门后面怎么走,还是拼组织能力。
四、给你的三件马上能做的事
说了这么多,落到行动上。大模型进入"交付结果"时代,企业现在最该做的,是三件事。
第一,重构采购标准。
别再问"哪个模型最聪明"了。要问三个新问题:这个Agent能不能把任务跑成闭环?它的过程能不能被审计、出错能不能被干预?它能不能接进我现有的业务系统和权限体系?Anthropic在2026年7月的一项研究值得参考:他们首次观测到Claude内部存在一个类似人类"全局工作空间"的J-space,能通过J-lens技术读取、审计甚至干预模型正在"想"什么。这不是噱头,而是Agent进入生产环境后,"可审计、可干预"会成为硬指标。买模型,要买"可被监管的结果",不是"黑箱里的聪明"。
第二,重算一遍ROI。
把你团队里"重复性的知识工作"列一张清单:周报、客服首轮应答、代码初稿、合同初审、数据报表、竞品监控……然后按2026年7月的新成本重新算一遍账。德勤说66%的组织已经看到生产率收益——但很多收益卡在"没推进到生产"。成本线已经低于你心里的盈亏线了,卡住你的往往不是钱,是没把它当成正经流程来排。
第三,建立"委派"文化,而不是"问答"文化。
这是最容易被忽略、却最关键的一点。绝大多数人用AI的方式,还是"我问一句,它答一句"。但新模型的能力,是建立在"你把一个目标当工单派出去,它自己拆解、调用工具、跑完回来交付"之上的。
怎么判断一个任务该不该交给Agent?给你一个简易"三问法":
一问,这活儿能不能拆成明确的步骤?能拆,才跑得动。 二问,产出能不能被验证?有可验证的交付物,才不会跑偏。 三问,万一失败,代价是否可控?代价可控,才敢放权。
三步都答"是",就别再自己扛,派给Agent。三步里有"否",就先把它拆到能答"是"为止,再派。
写在最后
大模型这一年的竞争,主线变了三次:最早比参数,后来比工程(上篇讲的56%落地真相),而2026年7月这一周,比的是"交付"。
模型开始接活儿了。这不是噱头,是德勤66%和25%之间那道缝、是Meta四分之一定价、是DeepSeek开源提速85%、是Grok单任务Token减半共同指向的现实。
下一个十年,赢家大概率不是"模型最强"的那一家,而是"最会把活儿委派出去"的那些组织。
门已经被成本撞开,工单已经可以派发。剩下的,看谁先动。
更多推荐




所有评论(0)