大模型的“下一站”:从“会聊天”到“理解世界”
引言
2026年7月,上海世博展览馆。WAIC 2026的H1馆里,几乎听不到“我们的模型有多少参数”这种话了。取而代之的是另一个更务实的问题——“你的AI能替我干什么?”
H3具身智能馆的画风变化更大:往年热闹的机器人特技表演退居次要,200余家企业扎堆亮出能上岗、能落地的实用机型。行业正式从“身体内卷”转入“脑力比拼”。
一个清晰的信号正在释放:大模型的下半场,不再是“谁更大”,而是“谁更能理解世界”。
一、LLM的边界:为什么“会聊天”远远不够
过去三年,大语言模型用“下一个Token预测”这个简单规则,创造了一个又一个奇迹。但当模型进入万亿参数量级、数据中心投资持续攀升,一个问题变得越来越现实:这条路径还能走多久?
图灵奖得主杨立昆给出了一个极端的判断:以大语言模型实现超级智能是死胡同。在他看来,当前主流LLM的基本训练目标是根据上下文预测下一个Token,这个机制非常适合语言生成,却不天然等同于理解、计划和因果推理。
毕马威在WAIC 2026期间发布的报告也给出了类似判断:大模型无法独自通向AGI,能理解物理规律并在内部“推演未来”的世界模型,才是赋予具身智能“观察、推理、行动”心智闭环的关键架构。
大语言模型是知识的容器,但它缺乏对真实世界复杂因果的理解。它能告诉你“杯子掉在地上会碎”,但它不知道杯子有多重、掉落的角度如何影响碎裂方式、碎片会飞向哪里。它“知道”世界,却不“理解”世界。
二、世界模型:给AI装上“物理直觉”
2.1 什么是世界模型?
如果用一句话概括:世界模型让机器像人一样,在行动之前先在脑海里推演一遍“我这么做,是否符合这个世界的物理规律”。
它不再只是根据上下文预测下一个词,而是根据当前状态预测下一步行动之后,世界状态将如何演化。它要在内部模拟物理规律——重力、摩擦力、接触力、因果关系——然后基于推演做出决策。
它石智航创始人陈亦伦在WAIC主论坛上说得很直白:“如果只预测动作,而不知道这个动作的结果,就无法保证机器人行为的可靠性。真正的世界模型,应当同时理解动作与环境之间的因果关系。”
2.2 VLA的局限与世界模型的补位
过去两年,VLA(视觉-语言-行动模型)一度被视为具身智能的“标准答案”。它擅长看懂场景、听懂指令,但对物理世界缺乏真正理解,一遇到没见过的场景,泛化能力就明显打折——往往在实验室里表现很好,一进真实环境就崩。
单一的VLA或端到端神经网络虽然能够高效应对眼前的直接状况,但无法处理动作引发的连锁反应,难以判断当前动作在未来多步之后可能引发的后果。
世界模型则具备在行动前推演未来状态、穷举不同可能性并规划出最优行动路径的能力。两者的融合,可以弥补单一反应系统的功能缺失,共同构成更为完整的智能架构。
2.3 2026年的世界模型,已经走到哪了?
WAIC 2026上,世界模型的进展令人瞩目。
大晓机器人发布了开悟世界模型3.1(Kairos 3.1),这是全球首个端侧驱动本体的“行动一体化世界模型” 。它将生成智能、物理智能与认知智能融合在一个架构里,打通了“理解-推演-执行-反思”的全链路。8B模型的推理延迟仅125毫秒,相比同类型世界模型效率提升达52倍。更关键的是,它已经面向各行业开源。
阿里千问发布了Qwen-RobotWorld,一个面向具身智能、由语言驱动的视频世界模型,能够基于当前观测预测符合物理规律的未来视觉轨迹。该模型在EWM-Bench和DreamGen Bench上综合排名第一。
极智嘉发布了Gravity 4D模型,在三维空间之上叠加时间维度,让机器人不仅“看见”商品,还能预判堆叠、遮挡、移动中的物理变化。
穹彻智能展示的具身大模型则走了另一条路——完全依靠野外无本体采集数据完成训练,全程未使用任何遥操作数据。其智能药房方案已在沈阳等地的连锁药房完成部署,可对超过3000个SKU商品完成识别、抓取与操作。
世界模型正在从学术概念走向产业现实。
三、落地“最后一公里”:理想丰满,现实骨感
3.1 从“炫技”到“干活”
2026年被业界视为具身智能部署元年。在WAIC现场,具身智能企业不再像此前那样展现机器人的“舞蹈功底”,转而将真实产线搬到展台。
破壳智能创始人许华哲给出了一个有趣的AGI新解:A代表Agility(更敏捷的行动速度),G是Generalization(更强的泛化能力),I对应Infallibility(作业的可靠性)。“当这三点都实现,具身智能机器人就可以很好地落地。”
但现实远比理想复杂。
3.2 三堵“墙”
行业普遍认为,物理智能要实现规模化,必须突破三道墙:
第一道是数据墙。 真实交互数据极其稀缺,获取成本极高。国金证券研报指出,训练具备实际应用能力的具身智能模型,至少需要1000万小时多模态交互数据,而当前全球数据量尚不足需求的5%。有观点更直接:“你不能像爬取网页一样简单地‘爬取’这个世界的真实交互经验。”
第二道是表征墙。 跨任务、跨场景、跨本体的统一物理表征尚未形成。大晓机器人提出的“信息密度定律”点出了本质:数据的价值不在数量堆叠,而在信息密度。唯有当数据深度融入三维力触觉、失败恢复轨迹和开放场景变量时,世界模型才能真正获得泛化、反思与自进化的能力。
第三道是闭环墙。 真实试错代价昂贵、反馈缓慢,难以规模化。正如大晓机器人董事长王晓刚所说:“数字世界模型失误仅影响图文生成,而物理场景下智能体预判偏差将产生不可逆的真实损失。”
3.3 “鸡与蛋”的困局
具身智能面临一个经典的“鸡与蛋”困局:构建世界模型需要大量数据,然而现实中恰恰无法获取如此充足的数据;没有足够的数据,模型就难以落地;不落地,又无法在真实场景中采集数据。
这构成了物理智能从0到1最难跨越的鸿沟。
四、资本在押注什么?
尽管落地困难重重,资本却在一路狂奔。
毕马威报告显示,具身智能行业2025年融资额达111.7亿美元,同比增长152%;融资数量670笔,同比增长81%。2026年一季度融资额达50.3亿美元,同比增长182.9%。
世界模型赛道2026年上半年融资事件总数达42起,已基本和2025年全年持平。多家2023-2026年间成立的初创企业极短时间内估值便达到10亿美元。
有媒体统计,截至2026年6月中旬,国内具身智能赛道融资约438亿元,其中超过一半资金流向了聚焦基础模型、世界模型等智能层的“大脑派”公司,而传统机器人本体公司的融资占比已不足15%。
资本在用真金白银投票:“大脑”比“身体”更值钱。
五、争议:世界模型是答案,还是又一个泡沫?
热潮之下,争议从未停止。
DeepSeek创始人梁文锋在WAIC期间抛出了一个颇具争议的观点:世界模型不是通往AGI的路——它跟智能的路线图没有什么关系。在他看来,下一代模型的核心能力必须要有持续学习的能力。
“AI教母”李飞飞则将世界模型拆解为渲染器、模拟器、规划器三大类别,直言这是当今AI领域最重要也最被滥用的术语之一。
也有业内人士略带戏谑地指出:“今年只要有融资新闻的具身公司,基本上都在做世界模型。”当一个概念被所有人挂在嘴边,泡沫的嫌疑就难以回避。
杨立昆本人也并不主张用世界模型“取代”LLM,而是为两者划定清晰的分工边界——在他描绘的三层架构中,LLM作为“语言接口层”,世界模型层负责在抽象表征空间中建模物理世界、预测行动后果、进行多步规划。
这不是替代,而是升级。
写在最后
2026年的大模型行业,正在经历一场从“数字智能”到“物理智能”的范式转移。
大语言模型教会了AI“说话”,但要让AI真正“做事”,它需要理解这个世界——重力如何作用、物体如何运动、行动会带来什么后果。世界模型正在填补这个空白。
当然,这条路远未到终点。数据稀缺、表征未统一、闭环难建立——三堵“墙”依然矗立在前。资本的热潮与行业的争议交织,泡沫与价值并存。
但方向已经清晰:AI的下半场,不在屏幕里,在物理世界中。
正如陈亦伦所说:“世界模型理解世界,物理AI改变世界。”当数据、模型、算力和工程能力不断融合演进,那个让机器人在真实世界中持续创造价值的时刻,或许比我们想象的要近
在这里,我也给大家准备了学习资料,保证100%免费


更多推荐




所有评论(0)