@hanbingtao
2026-07-19T11:30:30.000000Z
字数 3845
阅读 18
大模型
构建能够在非结构化物理环境中感知、推理和行动的机器人,长期以来一直是具身人工智能研究的核心目标。近年来,该领域逐渐聚焦于一种强大的范式:视觉-语言-动作(VLA)模型,这类模型将预训练的视觉-语言骨干网络重新用作通用型机器人策略。通过将动作生成建模为基于互联网规模的视觉与语言表征的条件化标记预测,诸如RT-2 [2]、OpenVLA [3] 和 [4] 等VLA模型已展现出一定的泛化能力——能够遵循新颖的语言指令、操作前所未见的物体,并以极少的微调实现跨不同机器人本体的迁移。这些成果表明,在大规模视觉-语言预训练过程中积累的语义理解可以被有效地“落地”到具体的运动行为中,标志着相较于早期针对特定任务的控制器,这是一次质的飞跃。此后大量基于这一框架的研究工作进一步巩固了VLA模型作为通用具身策略学习主导范式的地位。
然而,标准的VLA模型并未显式地对世界动态进行建模——它们学习的是从观测到动作的直接映射,而不预测环境在干预下如何变化[4]。这种缺乏前瞻性物理推理的能力限制了其泛化性能,而在许多场景中预测未来状态至关重要。因此,为具身策略模型赋予世界建模能力成为一个自然的发展方向[5]。近年来越来越多的研究开始将世界模型集成到具身策略流程中。这些方法利用对环境动态的预测模型来赋予智能体物理上的预见能力——无论是通过视频预测实现视觉规划[6–10]、潜在动态建模用于策略条件化[11–15],还是在统一架构内进行联合状态-动作生成[16–22]。这一新兴方向迅速获得发展势头,催生了多样且不断扩展的方法体系。
我们将这一类方法形式化地称为“世界动作模型”(World Action Models, WAMs):即一类将预测性状态建模与动作生成相统一的具身基础模型,目标是建模未来状态与动作的联合分布,而不仅仅是单独的动作分布。现有的WAM方法大致可分为两类架构:(1) 级联式WAM明确分解目标函数,形式上写作,首先合成对未来状态的表征,再从中推导出动作;以及(2) 联合WAM直接建模联合分布,其中状态预测与动作生成在共享的表示空间内协同优化(参见图1了解这些架构的时间演进)。引入世界建模带来了更强的物理理解能力、在新环境中更好的泛化表现,以及能够利用缺乏动作标注的大规模人类视频数据的能力——从而显著拓展了可用于具身策略学习的数据基础。

世界动作模型(WAMs)代表性工作的时序演进与分类。左侧分支展示了联合WAM架构的发展路径,这类架构将世界预测与动作生成紧密耦合,并分化为自回归和基于扩散的表示方案,其中连续方法进一步分裂为统一流和多流主干网络。右侧分支总结了级联式WAM流程的发展,在该流程中世界建模与动作执行主要解耦,沿着显式和隐式的表示对齐轨迹演化。这些结构策略代表了该领域在架构耦合方面的主要探索方向,而非严格的顺序替代关系。
为建立世界动作模型(WAMs)的严谨基础,我们从概率视角定义具身智能任务。我们考虑一个与环境交互的具身智能体。在每个时间步,智能体接收观测值(包含视觉输入、本体感觉信号以及其他任何感知模态),语言指令,并生成动作。我们用表示下一时间步的观测值。
视觉-语言-动作(VLA)模型是一类具身基础模型,将机器人控制视为多模态序列建模任务。在此范式中,智能体处理当前观测值o和语言指令l,以生成一系列动作标记a。VLA架构通常利用大型语言模型(LLM)或视觉-语言模型(VLM)的预训练语义潜在空间,将感知输入直接映射到动作空间。形式上,VLA的目标由给定多模态上下文的动作条件概率定义:
世界模型(WM)被定义为一种预测性转移函数,用于内化物理环境的因果动力学。WM的功能角色是对世界的正向动力学进行建模——即在给定前一状态和一系列假设干预的条件下,模拟环境观测状态的演化过程。这通常表示为:
在此框架下,该模型充当状态的随机传播器,提供了一种关于环境如何响应特定动作而发生变化的表征方式。
世界动作模型(WAMs)是一类具身基础模型,它将环境动力学建模(即世界建模)与运动控制(即动作生成)统一起来。不同于学习直接从观测到动作映射的标准视觉-语言-动作(VLA)模型,WAMs能够预测物理环境的未来演化过程。正式地,一个WAM必须满足以下两个核心准则:
正式地,WAM旨在在一个统一框架中刻画未来状态与动作的联合分布或条件分布:
通过超越单纯的观测到动作映射,转向联合的状态-动作预测,WAMs利用丰富的时空先验知识,实现了更深层次的物理理解以及更强的零样本泛化能力。
为确保概念清晰,我们将世界动作模型(WAMs)与生成式机器人文献中的几个相关概念区分开来。
1 Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li, World Action Models: The Next Frontier in Embodied AI, 2026. URL https://arxiv.org/abs/2607.11689
[2] Anthony Brohan, et, al. Rt-2: Vision-language-action models transfer web knowledge to robotic control, 2023. URL https://arxiv.org/abs/2307.15818.
[3] Moo Jin Kim, et, al. Openvla: An open-source vision-language-action model, 2024. URL https://arxiv.org/abs/2406.09246.
[4] Kevin Black, et, al. : A vision-language-action flow model for general robot control, 2024. URL https://arxiv.org/abs/2410.24164.