@hanbingtao
2026-07-19T11:34:12.000000Z
字数 7298
阅读 20
大模型
世界模型能够对环境在动作、语言指令或多模态上下文下的演化过程进行建模,因此为超越静态数据集上的直接策略学习、提升VLA系统提供了一种关键机制。世界模型使VLA智能体能够在真实执行之前对未来观测进行推理、生成想象中的轨迹、估计轨迹、预测任务结果并评估策略行为。这一能力对于机器人学习尤为重要,因为在机器人学习中,真实数据采集成本高昂,物理交互可能存在安全隐患,且难以大规模开展全面的策略评估。我们从两个互补的视角讨论世界模型如何促进VLA的发展:学习与评估。在学习方面,世界模型可以增强模仿学习,支持基于模型的强化学习,并提供来自预测未来的奖励信号。在评估方面,它们充当数据驱动的模拟器,实现对VLA策略的可扩展、可重复且具备安全意识的测试。

模仿学习是视觉语言动作模型(VLA)的主要训练范式,其中机器人策略通过模仿专家演示进行学习。然而,其有效性在很大程度上受限于专家数据的数量不足和多样性缺乏。为解决这些限制,许多研究利用具身世界模型生成多样化的训练数据以用于模仿学习,从而提升其性能。DREMA [2] 通过将基于物体的高斯泼溅与物理模拟器相结合,构建了一个组合式操作世界模型,使机器人能够通过等变变换想象新颖的物体配置,并生成多样化的演示用于模仿学习,在真实机器人上实现了单次策略学习。Ctrl-World [3] 通过在想象中实现有效学习,显著增强了VLA模型的能力。它合成复杂任务的成功轨迹,并将其用于监督微调,从而使 -DROID [4]策略在下游任务上的成功率提高了44.7%。RoboScape [5] 表明,像 [6]和Diffusion Policy [7]这样的VLA策略在其合成数据上训练后,能达到与在真实世界演示上训练相当的性能。

强化学习是VLA中策略优化的重要范式。然而,其实用性常因现实世界中机器人部署的高成本与风险、难以设计有效的奖励函数以及在仿真环境中实现可靠的仿真到现实迁移而受到阻碍。世界模型通过对未来状态的预测来建模环境动态,同时提供具有环境理解能力和跨模态转换能力的结构化环境表示。这些特性使得它们能够缓解上述挑战:支持无需大量真实交互的安全且可扩展的策略学习,促进隐式奖励估计,并增强仿真到现实迁移的鲁棒性。因此,世界模型正越来越多地被应用于基于模型的强化学习设置中以支持策略学习。
作为替代环境的世界模型。许多研究采用世界模型作为替代环境以促进强化学习中的策略学习。在此范式中,智能体在学习到的世界模型内部执行想象中的展开(rollout)。随后使用特定任务的奖励函数或展开层级的一致性目标来计算预测轨迹的奖励值。Dreamer系列将PlaNet [13]引入的RSSM从规划扩展至策略学习,并展示了基于模型的强化学习在虚拟环境中的有效性。基于预训练的具备像素级生成能力的视频生成型世界模型,一些工作尝试将世界模型用作强化学习的环境。这类方法将由策略生成的动作连同当前观测输入世界模型,进而由该模型预测未来的观测结果;然后利用这些生成的观测对策略进行训练。另一类工作则利用世界模型生成的轨迹,并衡量其与目标未来状态之间的一致性程度,以此信号引导策略学习。

除了充当策略学习的模拟器外,近期还有一些研究探索更直接与奖励建模耦合的世界模型,使得奖励信号可以从学习到的生成表征或联合建模的环境动态中推导出来,而非完全依赖外部指定的奖励函数。一类工作直接从预训练的生成式世界模型中提取奖励信号。VIPER [14]利用预训练的视频预测模型评估观察到的轨迹与成功行为所学习到的动力学之间的兼容性,并将此信号作为无动作参与的奖励用于强化学习。Diffusion Reward [15]通过条件视频扩散模型从专家视频中学习视频生成分布的条件熵,从中导出奖励信号。GenReward [16]利用预训练的视频扩散模型,通过测量智能体观测与生成目标视频之间的潜在对齐程度,提供目标驱动的奖励信号,从而为策略学习提供视频级别的指导。SRPO [17]利用V-JEPA 2的潜在空间作为预训练的世界表示来进行奖励塑形。通过将成功和失败的轨迹编码到潜在世界空间中并度量其行为相似性,SRPO为失败的展开分配按进展分级的奖励,为VLA-RL提供更密集的监督,在不增加额外专家演示或人工设计奖励函数的情况下缓解了奖励稀疏性问题。另一类工作将奖励预测直接集成进世界模型之中。例如,RoboScape-R [18]联合建模未来观测与奖励,使学习到的世界模型能够在想象中的展开过程中生成奖励信号,从而为强化学习提供一种内源性奖励机制。

在物理系统上评估机器人策略可能耗时、资源密集、存在安全隐患且不可复现。一种常见的替代方案是在人工设计的模拟器中进行评估,例如IsaacGym [19] 和MuJoCo [20] 。然而,这些模拟器往往难以捕捉真实环境的复杂性和多样性,导致显著的仿真到现实差距(sim-to-real gap)。
通过直接从数据中学习环境动态,世界模型能够构建数据驱动的仿真环境,更忠实地反映真实世界的复杂性与变异性。这使得可以在完全虚拟的环境中进行大规模策略测试,从而减少对昂贵且危险的物理评估的依赖。此外,其执行闭环推演(closed-loop rollouts)的能力支持一致且可复现的评估协议,缓解了真实世界实验中的不可复现问题。另外,世界模型通过将仿真建立在真实数据分布基础上,能够更好地弥合仿真与现实之间的差距,从而在部署前提供更可靠的策略性能估计。一种常见方法是在想象的虚拟环境中推演策略并预测其后果。Ctrl-World [3] 通过帧级动作条件化将动作信号注入每一帧,支持策略与模拟器之间的闭环交互以进行策略评估。Veo Robotics [21] 利用一个基于动作条件的视频生成模型作为世界模拟器,在不进行真实世界执行的情况下评估机器人策略。Veo Robotics还利用生成式图像编辑技术合成超出训练数据分布的场景,用于泛化能力测试,并通过模拟安全关键情境来进行红队测试(red teaming),所有预测结果均经过大量真实世界评估验证。一些研究还探索增强基于世界模型的模拟器中的交互性以及人在回路控制。Interactive World Simulator [22] 通过构建实时远程操作接口,使用户能够与世界模拟器进行交互,从而实现更全面的仿真环境。许多类似的工作也提升了评估的质量、效率和灵活性 [23–25] 。
[1] Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li, World Action Models: The Next Frontier in Embodied AI, 2026. URL https://arxiv.org/abs/2607.11689.
[2] Leonardo Barcellona, Andrii Zadaianchuk, Davide Allegro, Samuele Papa, Stefano Ghidoni, and Efstratios Gavves. Dream to manipulate: Compositional world models empowering robot imitation learning with imagination, 2025. URL https://arxiv.org/abs/2412.14957.
[3] Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, and Chelsea Finn. Ctrl-world: A controllable generative world model for robot manipulation, 2026. URL https://arxiv.org/abs/2510.10125.
[4] Physical Intelligence, et, al. : a vision-language-action model with open-world generalization, 2025. URL https://arxiv.org/abs/2504.16054.
[5] Yu Shang, Xin Zhang, Yinzhou Tang, Lei Jin, Chen Gao, Wei Wu, and Yong Li. Roboscape: Physics-informed embodied world model, 2025. URL https://arxiv.org/abs/2506.23135.
[6] Kevin Black, et, al. : A vision-language-action flow model for general robot control, 2024. URL https://arxiv.org/abs/2410.24164.
[7] Cheng Chi, Zhenjia Xu, Siyuan Feng, Eric Cousineau, Yilun Du, Benjamin Burchfiel, Russ Tedrake, and Shuran Song. Diffusion policy: Visuomotor policy learning via action diffusion, 2024. URL https://arxiv.org/abs/2303.04137.
[8] Danijar Hafner, Timothy Lillicrap, Jimmy Ba, and Mohammad Norouzi. Dream to control: Learning behaviors by latent imagination, 2020. URL https://arxiv.org/abs/1912.01603.
[9] Danijar Hafner, Timothy Lillicrap, Mohammad Norouzi, and Jimmy Ba. Mastering atari with discrete world models, 2022. URL https://arxiv.org/abs/2010.02193.
[10] Danijar Hafner, Wilson Yan, and Timothy Lillicrap. Training agents inside of scalable world models, 2025. URL https://arxiv.org/abs/2509.24527.
[11] Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, and Timothy Lillicrap. Mastering diverse domains through world models, 2024. URL https://arxiv.org/abs/2301.04104.
[12] Philipp Wu, Alejandro Escontrela, Danijar Hafner, Ken Goldberg, and Pieter Abbeel. Daydreamer: World models for physical robot learning, 2022. URL https://arxiv.org/abs/2206.14176.
[13] Danijar Hafner, Timothy Lillicrap, Ian Fischer, Ruben Villegas, David Ha, Honglak Lee, and James Davidson. Learning latent dynamics for planning from pixels, 2019. URL https://arxiv.org/abs/1811.04551.
[14] Tao Huang, Guangqi Jiang, Yanjie Ze, and Huazhe Xu. Diffusion reward: Learning rewards via conditional video diffusion, 2024. URL https://arxiv.org/abs/2312.14134.
[15] Qi Wang, Mian Wu, Yuyang Zhang, Mingqi Yuan, Wenyao Zhang, Haoxiang You, Yunbo Wang, Xin Jin, Xiaokang Yang, and Wenjun Zeng. Goal-driven reward by video diffusion models for reinforcement learning, 2025. URL https://arxiv.org/abs/2512.00961.
[16] Qi Wang, Mian Wu, Yuyang Zhang, Mingqi Yuan, Wenyao Zhang, Haoxiang You, Yunbo Wang, Xin Jin, Xiaokang Yang, and Wenjun Zeng. Goal-driven reward by video diffusion models for reinforcement learning, 2025. URL https://arxiv.org/abs/2512.00961.
[17] Senyu Fei, Siyin Wang, Li Ji, Ao Li, Shiduo Zhang, Liming Liu, Jinlong Hou, Jingjing Gong, Xianzhong Zhao, and Xipeng Qiu. Srpo: Self-referential policy optimization for vision-language-action models, 2025. URL https://arxiv.org/abs/2511.15605.
[18] Yinzhou Tang, Yu Shang, Yinuo Chen, Bingwen Wei, Xin Zhang, Shu'ang Yu, Liangzhi Shi, Chao Yu, Chen Gao, Wei Wu, and Yong Li. Roboscape-r: Unified reward-observation world models for generalizable robotics training via rl, 2025. URL https://arxiv.org/abs/2512.03556.
[19] Viktor Makoviychuk, Lukasz Wawrzyniak, Yunrong Guo, Michelle Lu, Kier Storey, Miles Macklin, David Hoeller, Nikita Rudin, Arthur Allshire, Ankur Handa, and Gavriel State. Isaac gym: High performance gpu-based physics simulation for robot learning, 2021. URL https://arxiv.org/abs/2108.10470.
[20] Emanuel Todorov, Tom Erez, and Yuval Tassa. Mujoco: A physics engine for model-based control. In IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2012.
[21] Gemini Robotics Team, Krzysztof Choromanski, Coline Devin, Yilun Du, Debidatta Dwibedi, Ruiqi Gao, Abhishek Jindal, Thomas Kipf, Sean Kirmani, Isabel Leal, Fangchen Liu, Anirudha Majumdar, Andrew Marmon, Carolina Parada, Yulia Rubanova, Dhruv Shah, Vikas Sindhwani, Jie Tan, Fei Xia, Ted Xiao, Sherry Yang, Wenhao Yu, and Allan Zhou. Evaluating gemini robotics policies in a veo world simulator, 2026. URL https://arxiv.org/abs/2512.10675.
[22] Yixuan Wang, Rhythm Syed, Fangyu Wu, Mengchao Zhang, Aykut Onol, Jose Barreiros, Hooshang Nayyeri, Tony Dear, Huan Zhang, and Yunzhu Li. Interactive world simulator for robot policy training and evaluation, 2026. URL https://arxiv.org/abs/2603.08546.
[23] Yaxuan Li, Yichen Zhu, Junjie Wen, Chaomin Shen, and Yi Xu. Worldeval: World model as real-world robot policies evaluator, 2025. URL https://arxiv.org/abs/2505.19017.
[24] Julian Quevedo, Ansh Kumar Sharma, Yixiang Sun, Varad Suryavanshi, Percy Liang, and Sherry Yang. Worldgym: World model as an environment for policy evaluation, 2025. URL https://arxiv.org/abs/2506.00613.
[25] Yaxuan Li, Zhongyi Zhou, Yefei Chen, Yaokai Xue, and Yichen Zhu. dworldeval: Scalable robotic policy evaluation via discrete diffusion world model, 2026. URL https://arxiv.org/abs/2604.22152.