世界模型引领具身智能革命:技术突破与商业落地的双重挑战
2026-08-28 11:18:51未知 作者:徽声在线
徽声在线记者 | 徐美慧
徽声在线编辑 | 文姝琪
步入2026年,机器人领域的发展重心正悄然从硬件本体向智能“大脑”转移,世界模型作为这一变革的核心驱动力,迅速成为行业焦点。
光象实验室首席科学家吕尧在近期接受徽声在线等媒体采访时指出,评估世界模型的标准不应局限于生成画面的逼真度,更需关注模型能否理解动作与世界变化的因果关系。他强调,只有掌握物理世界的底层规律,才能实现真正意义上的通用具身智能。
然而,在理解世界之后,如何构建机器人行动架构仍是待解难题。行业尚未就技术路线达成共识,不同团队正从不同维度展开探索。
当前具身智能领域关于“大脑”的研发路径,主要围绕VLA与世界模型两大方向展开。这两种技术路线虽非完全对立,但在实现逻辑上存在显著差异:
VLA(视觉-语言-动作模型)通过建立视觉、语言输入与机器人动作的直接映射关系,典型实现方式是利用机器人示范数据训练模型,使其能够根据环境观测和指令生成相应动作。这种端到端的方式在特定场景下效率较高,但泛化能力受限。
世界模型则代表另一类技术范式,包括以Sora为代表的生成式模型、World Labs主导的空间智能模型,以及JEPA等视觉表征模型。这些模型虽表现形式各异,但都遵循通过海量数据学习世界统计特征的基本逻辑,核心目标是从观测数据中预测未来状态变化。这种技术路线更注重对物理规律的建模,但实现复杂度也显著提升。
技术路线的争议并非新话题。在2025年世界机器人大会上,宇树科技创始人王兴兴就曾公开质疑VLA路线的局限性。他认为,制约人形机器人大规模应用的关键在于AI模型架构设计,而非硬件性能或数据规模。
王兴兴将VLA形容为“简单直接的架构”,并指出其缺乏对物理世界的深度理解。相比之下,他更看好基于视频生成模型或世界模型的驱动方式,认为这种技术路径在复杂场景中的适应能力更强,最终实现技术突破的概率更高。
经过一年发展,世界模型的热度持续攀升,但技术路线分歧反而更加明显。行业在探索过程中逐渐发现,不同技术路径的优劣并非绝对,而是取决于具体应用场景的需求。
对于VLA路线的发展瓶颈,吕尧给出了更具体的技术分析。他认为,当前VLA架构已接近性能天花板,其语言模型前端与动作专家后端的连接方式存在根本性缺陷——语言符号与动作空间的模态差异导致信息传递效率低下,单纯依靠扩大数据规模难以突破泛化能力的瓶颈。
这种技术认知的变化正在重塑行业格局。吕尧观察到,部分团队因VLA竞争激烈而转向世界模型研究,另一些团队则是在内部验证中发现VLA的局限性后主动调整方向。但无论哪种情况,行业都开始重新审视原有技术路线的可行性。
尽管探索热情高涨,但世界模型仍面临基础性挑战——这个概念至今缺乏统一定义。这种概念模糊性直接导致研发方向的分散化。
李飞飞团队与World Labs在今年发表的专题论文中,尝试对世界模型进行系统分类。他们根据功能差异将其划分为渲染器(renderers)、模拟器(simulators)和规划器(planners)三类:渲染器专注于生成视觉画面,模拟器需要准确描述物理规律,规划器则负责决策制定。值得注意的是,World Labs将VLA纳入规划器范畴,这暗示着两种技术路线可能存在融合空间。
按照这种分类框架,不同类型世界模型的技术要求差异显著。渲染器只需保证画面质量,模拟器必须准确建模物理引擎,而规划器则需要整合环境感知、目标理解和动作决策等多维度能力。这种功能分化为技术落地提供了更多可能性,但也增加了系统集成的复杂度。
对于技术路线的本质关系,智平方创始人兼CEO郭彦东在北京智源大会上提出了不同观点。他认为,世界模型不应被视为VLA的替代方案,而应成为VLA体系的核心组件。这种观点为两种技术路线的融合提供了新的理论依据。
技术路线之争背后,是更现实的工程挑战。某世界模型研发企业负责人向徽声在线透露,当前视频生成模型在物理属性表达上仍存在明显不足。例如,模型可以生成逼真的物体运动画面,但难以准确模拟摩擦力、弹性等物理参数。这种缺陷导致生成数据在机器人操作训练中的实用性大打折扣,迫使企业不得不投入大量资源进行真实数据采集。
该负责人进一步指出,行业连机器人能力分级标准都尚未建立,这严重制约了技术评估和产品开发。当前工业机器人只能完成边界明确、流程固定的简单任务,而家庭服务等开放场景任务需要机器人具备环境理解、因果推理和动态调整能力,现有技术距离这一目标仍有显著差距。
面对这些挑战,光象科技选择了独特的技术路径。该公司与清华大学李升波教授课题组联合研发的Phi-WM 1.0 ActEffect模型,从“动作如何改变世界”的角度重新定义问题。该模型的核心创新在于将世界模型转化为训练阶段的反馈机制,使机器人能够理解不同动作产生的后果。
具体实现上,ActEffect模型可以同时生成三个不同精细度的动作方案,并预测每个方案可能引发的环境变化。通过比较这些预测结果,系统能够筛选出最优动作方案。更关键的是,在模型部署阶段,世界模型被移出推理链路,策略网络通过单次前向计算即可直接输出动作,显著提升了实时性能。
吕尧用“知识蒸馏”来解释这种设计思路。他将世界模型对动作后果的判断能力提前“提炼”到策略网络的权重参数中,从而在部署阶段无需重复计算世界模型,既保证了决策质量,又降低了计算资源消耗。
图片来源:视觉中国
除了模型架构,数据问题也是制约行业发展的关键因素。世界模型能否减少机器人对真实数据的需求,目前仍无定论。
吕尧对这个问题进行了深入分析。他认为,纯视频预测型世界模型不太可能降低数据需求,因为训练一个具备足够泛化能力的视频预测模型本身就需要海量数据。这种模型生成的数据质量也难以保证,可能无法有效替代真实数据。
“但如果世界模型能够从数据中提取跨场景通用的物理规律,就有可能减少对特定场景数据的需求。”吕尧补充道。这种思路如果成立,将显著降低机器人适应新环境的成本。
光象科技创始人兼CEO张涛用具体案例解释了这种数据效率提升机制。他举例说,传统方法需要让机器人通过十次真实投掷来学习不同物体的投掷技巧,而世界模型可以在仿真环境中进行数千次反事实推理,探索各种可能的投掷方式。这种虚拟试错虽然需要大量计算,但成本远低于真实设备操作。
吕尧进一步量化了这种数据需求变化。他认为,反事实试错数据可能是真实成功示范数据的10到100倍,但真机训练时间可以控制在几十小时内。按照光象的方案,世界模型将大部分试错过程转移到成本较低的仿真环境,从而减少对昂贵真机数据的需求。这种数据利用方式的变革,可能成为突破机器人学习效率瓶颈的关键。
然而,技术突破最终需要接受商业市场的检验。在工业机器人领域,企业更关注技术方案的投资回报率,而非技术路线的理论优势。
IDC今年8月发布的市场研究显示,2025年中国工业具身智能机器人市场规模约为57.4亿元。该机构的用户调研发现,超过80%的制造企业希望工业机器人项目能在两年内收回投资。这种商业压力迫使技术提供商必须优先考虑方案的快速部署能力和运行稳定性。
这意味着,对于工业客户而言,VLA和世界模型的技术路线之争并不重要,他们更关心的是系统能否在预定时间内产生经济效益。这种现实需求可能倒逼技术方案向更实用的方向演进。
尽管技术路线尚未统一,但资本市场对世界模型的热情持续高涨。CB Insights数据显示,世界模型相关投资额从2024年的14亿美元激增至2025年的69亿美元,增长近5倍。这种投资热度反映出市场对技术变革的强烈预期。
进入2026年,大额融资仍在继续。2月,李飞飞创办的World Labs宣布完成10亿美元新融资;3月,Yann LeCun参与创办的AMI Labs也获得10.3亿美元融资。这两家公司的技术方向都聚焦于真实世界建模:World Labs专注于空间智能和世界模型,AMI Labs则将建模、推理和规划作为核心研发方向。
资本的提前布局加速了技术迭代,但机器人真正融入现实生活仍需时日。当前技术方案在复杂场景中的适应能力、系统稳定性和成本效益等方面,都还未达到商业化要求。
“这个行业可能会像当年的自动驾驶领域一样,经历一次大规模洗牌。”吕尧向徽声在线等媒体预测道。他认为,随着资本市场逐渐回归理性,缺乏核心技术积累和实际交付能力的企业将率先被淘汰,只有具备真正技术突破的企业才能生存下来。
这种行业变革可能比预期来得更快。张涛分析认为,如果技术进展持续缓慢,一到两年内行业确实可能面临寒冬。但他同时指出,如果出现第一个被市场验证的、具备规模化潜力的商业应用,整个行业格局可能发生根本性改变。这个“杀手级应用”的出现,将成为决定行业命运的关键变量。


