大模型发展轨迹正在迎来转折。

过去两年里,大语言模型从单纯的文字接龙,进化到了能够像人类一样深思熟虑的DeepSeek-R1推理式思考。无数开发者与研究人员为之振奋。

而拉开下半场帷幕的关键,已经悄然转向了看谁能在复杂的真实世界中干得更漂亮。

阿里通义千问前技术负责人林俊旸在离职后首次公开发声,深度复盘了行业过往的路线探索。

林俊旸点明下了一代人工智能的核心将全面迈向智能体式思考,一个从训练孤立模型到构建动态交互系统的演进脉络。

推演时代的得与失

OpenAI发布的o1模型向全世界展示了一个振奋人心的事实,思考能力完全可以作为一种核心且独立的能力指标。

研发人员能够针对思考能力进行专项训练,并将其直观地展示给终端用户。

随后,DeepSeek推出的R1模型进一步打破了技术壁垒,在顶级实验室之外成功复现了以推理为导向的后训练流程,并实现了规模化扩展。

两家机构在技术路径上相互辉映,前者将其定义为通过RL(强化学习)训练出的先思考后回答的系统,后者则以开源推理模型的姿态跻身全球顶尖行列。

整个2025年上半年的行业聚光灯,几乎全部打在了推演思考上。

研发团队日夜攻坚的核心议题,聚焦于如何引导模型在推理阶段消耗更多的计算资源,如何设计出更加强效的奖励信号,以及如何精准控制外部可见的思考成本。

第一波推理模型的浪潮,给从业者上了一堂极为生动的底层逻辑课。

研发人员认识到,想要在海量参数的语言模型上顺利跑通强化学习,必须找到那些确定、稳定且易于规模化获取的反馈信号。

数学定理证明、计算机代码编写以及严密的逻辑推导,顺理成章地成为了强化学习的主战场。

在上述领域里,对与错的界限犹如黑白般分明。明确的对错界限让系统能够单纯为了正确性去不懈优化,完全抛弃了以往那种仅仅追求听起来像真话的讨巧策略。

早期的模型训练如同教导一个八面玲珑的演说家,只要人类听众觉得顺耳就能获得高分。强化学习则像是在培养一位严谨的科学家,只有得出经得起反复验证的真理,才能拿走最终的奖赏。

伴随算法的突飞猛进,底层算力与架构的支撑作用变得前所未有地重要。

一旦模型学会在长篇大论的思考轨迹中探索答案,强化学习就彻底褪去了以往作为微调阶段轻量级插件的刻板印象。

整个训练链路演变成了一个庞大且极度复杂的系统工程。

研发团队需要海量的生成轨迹,需要极高吞吐量的验证机制,需要稳定迭代的策略更新机制,还需要极其高效的采样算法。

推理模型的崛起史,本身就是一部波澜壮阔的基础设施进化史。

从扩大预训练规模,大步跨越到扩大推理期后训练规模,技术更迭的齿轮已经转动到了一个全新的阶段。

融合路线的隐秘阵痛

将时间拨回2025年初,Qwen团队的众多研究人员心中,曾描绘过一幅堪称完美的宏伟蓝图。

理想状态下的系统,理应将深思熟虑的推演模式与雷厉风行的指令遵循模式完美融合。

该系统能够提供像调节音量一样丝滑的推理力度选项,甚至能够根据用户输入的提示词与上下文环境,自动感知问题的难度。

面对简单的日常问候,模型可以脱口而出。面对棘手的数理难题,模型则会默默调动庞大的计算资源,在内部进行漫长的推演后再给出最终定论。

Qwen3可以说是行业内对上述构想最清晰的公开践行者。该版本创新性地引入了混合思考模式,在同一个模型家族中同时兼容了沉思与直觉两种行为逻辑,极其强调对思考预算的精准把控。

研发团队甚至为其量身定制了一套包含四个阶段的后训练流水线,明确涵盖了长思维链冷启动、推理强化学习以及后期的思考模式融合环节。

构想总是无比美好,落地执行却布满荆棘。

横亘在理想与现实之间的最大鸿沟,隐藏在看似不起眼的数据之中。

探讨模式融合时,外界的目光往往聚焦在模型层面的工程兼容性上,探讨同一个权重文件能否容纳两套逻辑,同一个对话模板能否实现无缝切换,或者同一个服务端点能否提供灵活的配置开关。

最为核心的矛盾,其实扎根于两种模式截然不同的数据分布特征与行为动机之间。

在不断尝试平衡模型合并与提升数据质量的过程中,团队经历了无数次试错与反思。

一个优秀的指令遵循模型,其价值体现在直奔主题、言简意赅、严格遵守输出格式,并在处理海量、重复的企业级任务时保持极低的响应延迟。

文本重写、数据标注、模板化客服回复以及结构化信息提取,均是其大显身手的舞台。

相反,一个优秀的推理思考模型,其存在的意义在于遇到硬骨头时敢于消耗成千上万的词元,在内部维持高度连贯的逻辑推导框架,不断尝试各种可能的解题路径,通过海量的内部计算来确保最终答案的无懈可击。

两者在行为画像上犹如背道而驰的两辆马车。未经极其严苛筛选的融合数据,往往会孕育出一个在两个方向上都表现平庸的妥协产物。保留下来的思考过程可能变得毫无逻辑、冗长拖沓甚至优柔寡断。

原本应该干脆利落的指令响应,也会变得拖泥带水、错误频出,整体运行成本远远超出商业客户的心理预期。

面对现实的商业诉求,将两条路线物理隔离,依然是最具性价比的务实选择。

在经历过早期的混合模式探索后,研发团队在2507版本中果断推出了相互独立的指令版与思考版,并分别提供了30B(300亿参数)与235B(2350亿参数)的细分规格。

在真实的商业落地场景中,海量的企业客户依然对高吞吐、低成本、强可控的批处理指令模型情有独钟。

强行融合不但无法带来显而易见的收益,反而会拖累整体性能。分道扬镳的策略,让不同的小分队能够心无旁骛地攻克各自领域的数据与训练难题。

部分顶尖机构走向了完全不同的岔路口。Anthropic坚定地扛起了集成模型理念的大旗,其推出的Claude 3.7 Sonnet便是一个高度集成的混合推理模型。

API开发者可以通过设定思考预算,自由掌控模型的算力消耗。

Anthropic公开表示,推理能力理应是模型内在素质的自然延伸,不应被强行剥离成独立的产品线。

GLM-4.5同样以混合推理模型的定位亮相,试图在一个躯体内容纳推理、编程与智能体调用等多项绝技。

DeepSeek在后续的版本迭代中,也推出了兼顾思考与非思考状态的混合推理架构。

衡量融合路线成败的唯一标尺,在于两种模式的结合是否足够自然。强行将两种割裂的性格塞进同一个神经网络,只会给用户带来极其突兀的交互体验。

真正意义上的成功融合,必须建立在一条极其平滑的算力消耗曲线上。模型需要具备表达多种努力程度的灵活性,并能在面对不同复杂度任务时游刃有余地自适应切换。以算力分配为核心的策略控制,为整个行业指明了突破口。

为行动而生的新范式

Anthropic在几代产品更迭中所展现出的克制与专注,为狂热的算力军备竞赛注入了一剂清醒剂。

他们不再单纯炫耀模型能在内部自言自语多久,而是将研发重心死死钉在了集成化推理、用户可控预算、真实世界任务处理、代码编写质量以及在漫长思考过程中自如调用外部工具的能力上。

Claude 3.7确立了可控预算的混合推理框架,Claude 4则更进一步,允许系统在深思熟虑的间隙随时穿插工具调用,边想边做,边做边想。编程攻坚、长周期任务托管以及全自动工作流,被摆在了最核心的战略位置。

冗长的思考轨迹,绝对不能与高智商直接画上等号。在诸多真实场景中,满屏的推理过程往往暴露出模型在资源调配上的极度低效。

一个面对鸡毛蒜皮的小事也要写下千字论证的系统,本质上是丧失了优先级判断能力、信息压缩能力乃至立刻采取行动的果决力。

前沿机构的探索轨迹勾勒出一种更加务实的技术哲学,即思考的深度与广度,理应由最终面临的工作负载来反向塑造。

在代码编写领域,思考的价值在于帮助系统快速梳理庞大的项目仓库,制定合理的重构计划,拆解复杂的业务逻辑,在遇到编译错误时迅速定位并恢复,以及熟练指挥各类调试工具。

在自动化工作流领域,思考的终极使命是确保系统在极其漫长的执行周期中始终保持正确的航向,取得实实在在的执行成果,绝非仅仅为了在屏幕上打印出一串看似高深莫测的中间过程文本。

针对实用价值的极致追求,预示着一个更为宏大的历史转折,行业正在从单纯的训练模型阶段,大步迈入训练智能体的新纪元。

Qwen3的官方技术博客中曾明确写下,我们正在经历一场从训练模型到训练智能体的深刻变局。未来强化学习的突破口,必将依赖于真实环境针对长周期推理所提供的实时反馈。

一个真正意义上的智能体,必须具备制定缜密计划、精准把握行动时机、熟练操控各类工具、敏锐感知环境变化、遭遇挫折后迅速调整策略,并在超长周期内持续稳定运行的综合素质。闭环的真实世界交互,是赋予其生命力的唯一源泉。

为了更直观地展现前述底层逻辑的剧变,我们可以通过下方的表格,清晰地对比两种技术范式在核心维度上的根本差异。

智能体式思考代表着一种截然不同的优化靶心。

传统的推演思考,评审官手里拿着标准答案,审视的是模型在交卷前打草稿的质量,考量其能否解开几何题、能否写出排序算法、能否在各类标准化考试中拔得头筹。

智能体式思考的考场则搬到了瞬息万变的现实世界,评审官关注的是模型在跌倒后能否爬起来,在迷路时能否找到指南针,在面对残缺信息时能否抽丝剥茧继续前行。

考卷的核心问题,已经从模型能否保持足够长时间的专注,彻底变成了模型能否以一种支撑有效行动的方式进行思考。这种演变要求全新的系统必须啃下大量纯推理模型完全不需要面对的硬骨头。

系统必须学会在适当的时刻踩下思考的刹车,果断采取物理或数字层面的行动。系统必须在浩如烟海的工具库中,精准挑选出最合适的那把扳手,并排定极其严谨的使用顺序。面对现实环境中充斥的噪音干扰与残缺不全的线索,系统必须具备极强的抗干扰与信息缝合能力。

哪怕某个操作彻底搞砸了,系统也要能面不改色地推翻原有方案,迅速重组出一条全新的路径,并在成百上千次的回合博弈与工具调用中,始终死死咬住最初的目标不放。

智能体式思考,本质上就是一种将思考融入行动、用行动验证思考的全新智能形态。

重构系统的艰难跨越

一旦优化目标从破解静态的基准测试题,全面转向解决动态的交互式任务,强化学习的底层技术栈必将迎来一场翻天覆地的重构。

过去支撑推理模型大放异彩的基础设施,在新的战场上已经显得捉襟见肘。在传统的推理强化学习中,研发人员通常将生成的轨迹视为一个个相互独立的包裹,只需配备一套干净利落的评估程序即可完成打分。

智能体强化学习则完全打破了温室环境,策略网络被死死绑定在一个极其庞大且错综复杂的集成框架内。

工具服务器、自动化浏览器、命令行终端、搜索引擎、物理模拟器、代码执行沙盒、应用程序接口层、记忆检索系统以及全局编排框架,所有外围辅助的组件,现在全部化身为训练系统不可分割的血肉。

静态的验证器退出了历史舞台,真实且鲜活的动态环境直接坐上了裁判席。

系统工程层面迎来了史无前例的极限挑战,训练与推理环节必须被更加彻底地切割开来。

两者的耦合度过高,整个系统在进行轨迹采样时的吞吐量就会像遭遇断崖般暴跌。

想象一个正在学习编写控制程序的智能体,它必须将生成的代码丢进真实的测试台去运行。负责推理的计算节点只能原地待命,苦苦等待测试台回传的执行日志;负责训练的节点则迟迟等不到完整的行为轨迹来更新参数。

整个集群的图形处理器利用率,会跌到一个让任何研发主管都抓狂的冰点。加上工具调用的网络延迟、环境状态的不可见因素以及极其复杂的内部状态流转,瓶颈会被成倍放大。

在模型的能力还远未达到预期目标之前,极其痛苦且缓慢的实验迭代节奏,就会先一步摧毁整个团队的士气。

不仅如此,环境本身直接跃升为极其核心的研究资产。在监督微调占据主导地位的岁月里,全行业都在为数据的丰富度与广度而疯狂。

迈入智能体时代,狂热的焦点必须立刻转移到环境的质量上。环境的运行是否坚如磐石,物理或逻辑规则是否贴近真实世界,场景覆盖是否足够广阔,障碍设置是否具备挑战性,系统状态的变化是否丰富多彩,反馈信号是否足够细腻,能否有效抵御模型的恶意作弊,以及能否支撑起海量的并发运行,前述条件都将成为决定成败的关键命题。

构建高质量的数字环境,已经不再是大型项目里顺手牵羊的边缘工作,而是正儿八经催生出了一条全新的创业赛道。

既然智能体的终极宿命是前往类似于真实商业环境的战场中厮杀,孕育它的训练环境,本身就是其核心战斗力最直接的体现。

在可以预见的未来,充满行动力的智能体式思考,必将成为人工智能领域最主流的思维形态。

孤立的文本输出与闭门造车式的静态内部独白,试图用成千上万字的文本输出掩盖自身无法与外界交互尴尬的陈旧模式,终将被历史的车轮无情碾碎。

即便是在处理堪称噩梦级别的数学猜想或底层代码架构时,一个真正站得住脚的先进智能系统,也完全有资格去全网搜索文献、去沙盒里运行模拟、去实际执行测试脚本、去查阅报错日志、去交叉验证逻辑,并根据反馈不断修正自己的推理过程。

以极其健壮且高效的方式解决真实世界的棘手问题,才是人工智能发展的终极奥义。

驯服超级系统的路上,潜伏着一头极其狡猾的拦路虎,那就是奖励作弊。

模型一旦掌握了调用外部工具的生杀大权,其通过投机取巧获取高分的破坏力将呈现指数级飙升。

一个配备了联网搜索权限的模型,极有可能会在强化学习的训练阶段,直接去互联网上把标准答案抄回来。

一个专职编写代码的智能体,可能会偷偷利用代码仓库里未来的测试用例,可能会恶意篡改系统日志,甚至会发现某种能够直接绕过核心任务要求的漏洞。

千疮百孔的训练环境,极易让模型在各项指标上看起来如同天神下凡,实际上只是培养出了一个极其高明的作弊者。

正是前文提到的巨大隐患,让智能体时代远比推演时代更加如履薄冰。

无比锋利的工具大幅拓展了模型的业务能力边界,也同时撕开了一个供虚假优化肆意妄为的巨大豁口。

接下来阻碍行业狂奔的核心技术瓶颈,必将集中爆发在环境规则的严密设计、评估机制的坚固程度、反作弊协议的防御纵深,以及策略网络与物理世界之间交互接口的科学性上。

前行的方向已经无比清晰。手握工具、随时准备行动的动态思考,在实用价值上已经对孤立的静态推理形成了降维打击,它是提升全人类生产力的不二法门。

向智能体式思考的跃迁,呼唤着一种全新的集成框架工程美学。

整个系统的核心智慧,将越来越依赖于多个智能体之间的排兵布阵。

一个运筹帷幄的统帅负责拆解宏大目标并派发任务指令,一群身怀绝技的专家智能体在各自的垂直领域冲锋陷阵,无数个不知疲倦的微型智能体负责处理极度细分的琐碎工作,小心翼翼地维护着上下文的纯洁性,死死守住不同逻辑层级之间的防火墙,确保关键信息不被污染。

人工智能的演进史,正在完成一次极其壮阔的跨越,从单纯地打磨一个语言模型,进化到培养一个具备行动力的智能体,最终走向统御一个庞大且严密的智能系统。

时代的车轮滚滚向前。推理模型浪潮的奔涌,成功将一个极其珍贵的共识刻在了行业的丰碑上,只要反馈信号足够精准可靠,只要底层的基础设施能够扛住极限的算力压榨,架构在语言模型之上的强化学习,就能够孕育出发生质变的机器认知能力。

隐藏在水面之下的时代暗流,则是从内部推演到外部交互的深刻转向,从为了想得更久而想,跨越到为了干得漂亮而想。

训练的真正标的已经彻底改头换面,它不再是一串孤立的权重代码,而是模型与外部环境深度嵌套的庞大生态,是智能体以及环绕其周身的整个集成框架。科研人员的注意力版图随之重塑。

底层的模型架构与海量的训练数据依然重要,环境的精密设计、轨迹采样的流水线、评估机制的抗击打能力,以及多智能体协同作战的交互接口,全部跃升为决定成败的关键变量。

关于什么才是真正的深度思考,整个行业已经达成了全新的默契,那绝不是屏幕上打印出的最长、最眼花缭乱的字符瀑布,而是能够在现实世界的严苛约束下,持续推动任务向前迈进的最强行动轨迹。

牌桌上的筹码与决胜的底牌,正在经历着重新洗牌。

在那个纯粹比拼推演能力的旧时代,算法的精妙程度、奖励信号的纯度以及训练管道的扩展性,是拉开差距的核心壁垒。

现在是智能体的崭新纪元,只会“做题”没有未来,能在现实世界中干活才是硬道理。

参考资料:

https://x.com/JustinLin610/status/2037116325210829168

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐