[关闭]
@hanbingtao 2026-07-19T11:27:51.000000Z 字数 13685 阅读 17

世界模型(World Models, WM)

大模型


世界模型的定义长期以来一直是广泛争议的焦点。不同的研究采用了关于世界模型的不同定义。一个共识是,世界模型是一种内部表示,用于建模环境动态以及动作的影响。基于这种表示,它可以预测动作的后果,从而实现模拟、决策和规划。根据条件模式的不同,世界模型可以分为以动作为条件的世界模型和以语言为条件的世界模型。

动作条件化的世界模型

动作条件世界模型描述了环境如何响应智能体的动作而演化,其中动作指的是由智能体发出的可执行控制信号,这些信号直接干预环境并驱动状态随时间发生转移。给定当前状态和一个动作,该模型预测由此产生的未来状态或观测结果,从而捕捉动作对环境动态的因果影响。形式上,这一过程可以表示为:

其中下一个观测到的状态 是基于当前观测状态 和动作 进行预测的。根据建模和预测环境动态所处的空间不同,世界模型可分为两类:显式世界模型(Explicit World Models),其直接预测未来的观测值如像素或视频帧;以及隐式世界模型(Implicit World Models),其在潜在表征空间中建模环境动态。

显式像素级预测

早期的像素级预测模型直接在像素空间中操作,通过在像素级别预测未来帧来实现。ACVP [2]设计了一种编码-变换-解码的网络架构,是最早针对动作条件的像素级视频进行长期预测并评估的工作之一。CDNA [3]提出了一种动作条件的视频预测模型。通过显式地建模像素运动——即采用一种机制来预测变换分布——该模型能够从先前帧中移动像素以合成未来帧,而不是从头重建外观。Deep Visual Foresight [4]学习了一个动作条件的视频预测模型,该模型通过隐式的随机像素流来表示视觉动态。该模型通过生成随空间变化的流算子和掩码,使像素在时间维度上传输,从而实现概率性的像素级状态转移,而无需对光流、物体身份、姿态或物理状态进行显式监督。SV2P [5]进一步扩展了这类模型,将随机变分潜在变量引入视频预测中。通过对潜在变量采样,该模型能够生成多个合理的未来帧序列,而非单一的确定性预测,这一点在现实世界和动作条件设置中尤为重要,因为模糊的交互可能导致不同的结果。MCnet [6]通过非对称双流编码器分解运动与内容。通过分离这两个组件,模型将预测任务简化为基于识别出的运动特征对现有内容进行变换。ContextVP [7]利用并行多维LSTM(PMD)单元消除了像素预测中的盲区,这些单元在每个处理层聚合来自所有方向的上下文信息,并结合加权上下文融合模块来学习各个方向的重要性。

随着生成模型的持续进步,越来越强大的预训练视频生成模型不断涌现。在此基础上,许多近期工作探索基于视频的世界模型,利用此类预训练的生成模型直接在像素空间中预测未来的视觉观测。根据其生成公式的不同,这些方法可分为两种范式:自回归视频世界模型和基于扩散的视频世界模型。

自回归视频世界模型代表了一类重要的生成式世界模型。这类方法将视频帧标记化为离散的视觉令牌(tokens),并训练一个动态模型,使其基于过去的观测自回归地预测未来的令牌。基于VideoGPT [8]——一种具有类似GPT架构的预训练视频模型——iVideoGPT [9]设计了一种可扩展的自回归Transformer框架,将多模态信号(包括视觉观测、动作和奖励)整合为一系列令牌,通过下一令牌预测实现智能体与环境之间的交互。iVideoGPT的设计使其能够作为一个完整运行的世界模型发挥作用。Genie [10] 通过引入潜在动作模型进一步发展了交互式世界模型,该模型可以从无标签的视频片段中推断出动作变量,并用这些变量训练一个动态模型来预测未来的视觉令牌。这种设计使得世界模型可以在大规模互联网视频上进行训练,而无需动作标注,显著提升了世界模型训练的可扩展性。自回归公式允许世界模型生成任意长度的帧序列,因此适用于交互式世界建模。然而,这些模型存在严重的误差累积问题,可能难以有效建模高度多模态的分布。

基于扩散的视频世界模型通过显式建模可能未来观测的分布,进一步拓展了生成式世界模型的能力。它们通过对含噪声的时空信号进行迭代去噪,生成连贯的视频序列,且该过程依赖于数据或提示作为条件。不同于预测单一的确定性未来,扩散模型学习的是关于未来轨迹的条件分布,因而能够捕捉多模态的环境动态。这类方法在文本到视频生成领域已取得显著进展。基于扩散的视频模型正越来越多地被应用于世界建模。Diffusion World Model [11] 将世界建模表述为对未来视频帧的条件扩散过程。通过迭代去噪生成未来观测,该模型缓解了逐步动态预测中常见的误差累积问题。后续工作进一步深化了这一范式。由于采用了迭代去噪机制,基于扩散的视频模型通常在需要长时程一致性或高质量生成输出的任务中表现更优。然而,基于扩散的世界模型计算成本较高。

隐式潜在空间动态模型

为了克服像素级建模的低效性,一大类研究聚焦于在紧凑的潜在空间中学习动态。潜在动态模型将观测编码为潜在状态,并在该空间中学习状态转移函数。

循环状态空间模型(RSSM)

一些方法采用循环结构来预测潜在表征随时间的演化。David Ha和Jürgen Schmidhuber [12, 13] 提出了一种生成式循环神经网络(RNN),在无监督条件下训练以建模标准强化学习环境。受此思想启发,PlaNet [14]引入了循环状态空间模型(RSSM),该模型结合了确定性和随机性成分,以同时捕捉可预测的动态和不确定性。PlaNet证明了在潜在空间中学习动态的有效性。Plan2Explore [15]智能体将RSSM框架扩展至自监督探索,通过在潜在空间中进行规划以寻求预期的未来新颖性,并利用一组潜在动态预测器之间的分歧作为内在奖励。Dreamer系列及其后续的一些工作通过实现在潜在空间中的完全规划进一步扩展了这一框架,在提升样本效率的同时取得了优异性能。与此同时,LEXA [16]利用RSSM在潜在想象中训练探索者和达成者策略,用于无监督的目标条件强化学习。

Transformer状态空间模型(TSSM)

基于RSSM的世界模型可能会继承RNN的一些局限性。为了使世界模型能够受益于Transformer的发展,TransDreamer [17]提出了Transformer状态空间模型(TSSM),该模型利用Transformer来进行动态预测。TransDreamer及后续工作表明,采用基于Transformer的潜在序列建模的世界模型在建模长期依赖关系和推理能力方面优于Dreamer。

预测性表征学习

与重构观测或建模完整动态不同,预测性表征学习专注于对缺失或未来观测的潜在嵌入进行建模。JEPA [18],全称为联合嵌入预测架构(joint-embedding predictive architecture),提供了一种在抽象嵌入空间中学习预测性表征的通用范式。JEPA并不重构原始输入,而是学习从上下文信息中预测目标嵌入,促使模型捕获高层次的、可预测的结构,同时忽略低层次细节。该范式的一个实例是I-JEPA [19],它通过在同一图像内从一个上下文块预测多个目标块的潜在表征来学习图像表示。MC-JEPA [20]进一步将这一研究方向延伸至运动感知的视觉表征学习,通过在共享编码器中联合学习光流和内容特征,展示了自监督运动估计可以补充内容表征学习,并改善分割和视频理解所需的局部化表征。在此基础上,V-JEPA 2 [21]将JEPA范式扩展到基于视频的世界建模。通过预测未来的潜在嵌入而非重构像素,V-JEPA 2以更低的表征重构开销学习了更具抽象性和泛化能力的环境表示。进一步将其应用于具身控制,LeWorldModel [22]提出了一种端到端的JEPA模型,可直接从原始像素稳定地训练以进行潜在世界建模,用单一的高斯分布正则项(SIGReg)替代复杂的多项正则化目标,以防止表征坍塌,并支持连续控制任务中的高效潜在空间规划。除了视觉输入外,A-JEPA [23]将联合嵌入预测应用于音频频谱图,采用课程化的时间-频率掩蔽和潜在空间预测方法来学习可扩展的音频和语音表征。这种预测性表征学习的视角进一步激发了后续改进JEPA风格预测目标的研究,并将该范式推广至更广泛的具身和视觉-语言场景。

语言条件化的世界模型

与基于低级控制信号预测未来状态的动作条件世界模型不同,语言条件世界模型使用语言作为更高级、更抽象的条件形式。语言并不指定精确的动作序列,而是提供关于期望场景、事件或演化过程的语义指导,使模型能够生成符合文本或多模态指令的未来状态。形式上,这一范式可描述为:

其中l表示语言条件。

在此范式下,语言条件视频基础模型已成为世界模型中最具代表性的实现之一。通过从大规模视频-文本对中学习,这些模型获得了关于物体、场景、物理交互、相机运动和时序动态的丰富先验知识。因此,它们能够从高层语义描述中生成合理的视觉未来,从而为在语言指令下建模世界演化提供了自然的接口。现有方法已在多个关键维度上演进,包括生成目标、主干架构、潜在表征和扩展策略。因此,我们根据这种技术演进组织以下讨论,从早期基于GAN的视频生成器到基于扩散模型和Transformer的视频基础模型。

早期的视频基础模型主要基于GAN,例如MoCoGAN [24]、TGAN [25] 和DVD-GAN [26]。随后,随着扩散模型的引入,基于扩散的视频基础模型逐渐成为主导范式。

早期的基于扩散的视频基础模型建立在U-Net架构之上,该架构最初设计用于二维图像生成。视频扩散模型通过在标准二维U-Net架构中引入专门的时序层来实现时间一致性。早期的开创性工作如VDM直接将传统的二维卷积核扩展为三维卷积核,将视频序列视为统一的时空块进行处理。相比之下,其他方法则聚焦于注意力机制,利用跨帧注意力块在帧间共享信息,这一策略被Text2Video-Zero和AnimateDiff等模型采用,以保持物体外观和运动的一致性。

后续工作采用了Vision Transformer(ViT)作为视频扩散主干网络的更灵活替代方案。Sora和Latte [27]等模型将视频数据视为时空块的序列,使得模型比固定网格的U-Net能更有效地处理可变分辨率和时长。这一转变使模型能够受益于Transformer的可扩展性,通常采用因果注意力或时空自注意力来建模复杂动态并生成未来帧。

在RGB空间进行像素级扩散去噪计算成本高昂。为解决这一问题,LDM [28] 采用变分自编码器(VAE)将图像从像素空间压缩到潜在空间,并在该紧凑表示中进行去噪。受此启发,VideoGPT [8] 利用3D-VQVAE学习用于视频生成的离散潜在表示。后续工作进一步发展了这一范式。

随着视频基础模型设计的成熟,大量高性能的视频基础模型相继涌现。一些开源视频基础模型已展现出强大性能。Wan [29] 基于扩散Transformer(DiT)范式并结合流匹配框架,在视频生成、视频编辑、实时合成和音视频同步等多种应用中表现出卓越性能。其后续扩展进一步将Wan的能力专门化于角色动画 和运动控制 [321] 任务。许多闭源视频基础模型在互联网规模的数据上训练,展现出丰富的世界知识和强大的预测能力,有效充当了强大的多模态世界模型。代表性模型包括OpenAI的Sora 2 [30]、快手的Kling 3 [31]、谷歌的Veo 3 [32]、Runway的Gen-4 [33] 以及Pika Labs的Pika 2.2 [34]。

凭借强大的先验世界知识和卓越的语义理解能力,语言条件和多模态世界模型在数据合成和任务规划等应用中展现出巨大潜力。

具身世界模型

具身环境要求模型能够捕捉物理世界的动态,并预测世界如何响应智能体的交互而发生变化。这种预测未来状态的能力对于具身场景中的仿真、规划和数据合成至关重要。由于世界模型基于观测和动作来预测环境的演化,因此它们为具身环境建模提供了一个自然的框架。许多研究致力于提升具身环境中世界模型的预测精度、物理感知能力和动力学知识,旨在生成更真实的机器人演示并支持具身智能的发展。

互联网规模的大规模无标签视频包含了丰富的物理动态信息,从这类数据中学习对于预训练具身世界模型至关重要。一些工作使世界模型能够从人类操作视频或纯视频数据集中获取物理动力学特性。Genie [10] 引入了一种潜在动作模型,该模型以无监督方式从视频片段中推断出潜在动作,从而使得世界模型可以利用仅包含视频的互联网数据进行训练。SWIM [35] 基于Dreamer [36] 架构构建,它从人类操作视频中提取抓取点和运动轨迹,以缓解人与机器人之间显著的形态差异,从而实现从人类动作视频中学习机器人操控的动力学特性。DreamDojo [37] 通过将帧间运动编码为紧凑向量来引入连续的潜在动作表示,实现了与具体身体形式无关的动作表征,并支持从人类示范中进行跨具身形式的知识迁移。DexWM [38] 从第一人称视角视频中提取三维手部关键点来表示灵巧动作,采用手部一致性损失函数来捕捉精细的手指-物体交互细节,并实现向真实世界灵巧操作的零样本迁移。

为了提高由具身世界模型生成的机器人演示的质量,许多研究沿着多个互补方向展开探索,包括通过架构设计和数据驱动方法改进零样本生成能力、视频与指令对齐、多视图一致性和物理感知性。部分研究提升了零样本视频生成的鲁棒性。RoboDreamer [39] 利用自然语言固有的组合性,将视频生成分解为对多个底层原语的有条件控制,形成了一个具有强大零样本泛化能力的组合式世界模型,并能灵活地结合多模态指令。其他研究则专注于改善视频与指令之间的对齐效果。IRASim [40] 引入了一个帧级动作条件模块,将每个动作向量注入到Transformer块的空间注意力层中,从而使机器人动作能够对生成的视频内容施加更精确的控制。MiLA [41] 采用一种创新的“粗略到(重新)细化”的分治策略,通过将联合去噪校正流与时序渐进式的去噪调度相结合,在保持多视图空间对齐的同时有效解决了长时程生成过程中的误差累积和动态失真问题。另一类研究尝试统一多视角的机器人视频。Ctrl-World [42] 在空间变换器内部沿标记维度拼接来自多个摄像头的图像,从而实现了对所有视角的联合预测。此外,许多研究精心设计训练范式和数据处理流程以适应多视图生成的需求。还有一些研究着重于增强世界模型的物理感知能力。RoboScape [43] 通过自适应关键点动力学学习来提升物理感知建模,该方法结合了动态关键点采样与轨迹跟踪技术;同时提出了一种双分支协同自回归Transformer用于RGB流和深度流的协调生成,进一步增强了世界模型的物理信息处理能力。WoW [44] 提出了SOPHIA——一种自我优化框架,其中视觉-语言批评者评估生成的视频并指导提示词的优化,以提升物理合理性和因果一致性。WoW还集成了Flow-Mask逆动力学模型,该模型将预测的视觉转换映射为可执行的末端执行器动作,从而闭合了想象到行动的闭环。

另一类研究试图拓展世界模型的能力边界。VT-WM(Visuo-Tactile World Models)[45] 将触觉模态引入具身世界建模之中。它使用Sparsh-X模型将触觉信息编码成触觉标记,并将其沿空间维度与视觉标记拼接在一起,从而将触觉融入具身世界模型。PointWorld [46] 在三维点流表示下统一了环境状态和机器人动作。通过在大规模真实世界和模拟数据集上扩展训练,构建了一个通用的三维世界模型,该模型能够在多种不同的机器人操作任务间进行泛化,支持实时推理,并可直接集成至模型预测控制系统中。

参考资料

[1] Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li, World Action Models: The Next Frontier in Embodied AI, 2026. URL https://arxiv.org/abs/2607.11689
[2] Junhyuk Oh, Xiaoxiao Guo, Honglak Lee, Richard Lewis, and Satinder Singh. Action-conditional video prediction using deep networks in atari games, 2015. URL https://arxiv.org/abs/1507.08750.
[3] Chelsea Finn, Ian Goodfellow, and Sergey Levine. Unsupervised learning for physical interaction through video prediction, 2016. URL https://arxiv.org/abs/1605.07157.
[4] Chelsea Finn and Sergey Levine. Deep visual foresight for planning robot motion, 2017. URL https://arxiv.org/abs/1610.00696.
[5] Mohammad Babaeizadeh, Chelsea Finn, Dumitru Erhan, Roy H. Campbell, and Sergey Levine. Stochastic variational video prediction, 2018. URL https://arxiv.org/abs/1710.11252.
[6] Ruben Villegas, Jimei Yang, Seunghoon Hong, Xunyu Lin, and Honglak Lee. Decomposing motion and content for natural video sequence prediction, 2018. URL https://arxiv.org/abs/1706.08033.
[7] Wonmin Byeon, Qin Wang, Rupesh Kumar Srivastava, and Petros Koumoutsakos. Contextvp: Fully context-aware video prediction, 2018. URL https://arxiv.org/abs/1710.08518.
[8] Wilson Yan, Yunzhi Zhang, Pieter Abbeel, and Aravind Srinivas. Videogpt: Video generation using vq-vae and transformers, 2021. URL https://arxiv.org/abs/2104.10157.
[9] Jialong Wu, Shaofeng Yin, Ningya Feng, Xu He, Dong Li, Jianye Hao, and Mingsheng Long. ivideogpt: Interactive videogpts are scalable world models, 2024. URL https://arxiv.org/abs/2405.15223.
[10] Jake Bruce, Michael Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, Yusuf Aytar, Sarah Bechtle, Feryal Behbahani, Stephanie Chan, Nicolas Heess, Lucy Gonzalez, Simon Osindero, Sherjil Ozair, Scott Reed, Jingwei Zhang, Konrad Zolna, Jeff Clune, Nando de Freitas, Satinder Singh, and Tim Rocktäschel. Genie: Generative interactive environments, 2024. URL https://arxiv.org/abs/2402.15391.
[11] Zihan Ding, Amy Zhang, Yuandong Tian, and Qinqing Zheng. Diffusion world model: Future modeling beyond step-by-step rollout for offline reinforcement learning, 2024. URL https://arxiv.org/abs/2402.03570.
[12] David Ha and Jürgen Schmidhuber. World models. 2018. doi: 10.5281/ZENODO.1207631. URL https://zenodo.org/record/1207631.
[13] David Ha and Jürgen Schmidhuber. Recurrent world models facilitate policy evolution, 2018. URL https://arxiv.org/abs/1809.01999.
[14] Danijar Hafner, Timothy Lillicrap, Ian Fischer, Ruben Villegas, David Ha, Honglak Lee, and James Davidson. Learning latent dynamics for planning from pixels, 2019. URL https://arxiv.org/abs/1811.04551.
[15] Ramanan Sekar, Oleh Rybkin, Kostas Daniilidis, Pieter Abbeel, Danijar Hafner, and Deepak Pathak. Planning to explore via self-supervised world models, 2020. URL https://arxiv.org/abs/2005.05960.
[16] Russell Mendonca, Oleh Rybkin, Kostas Daniilidis, Danijar Hafner, and Deepak Pathak. Discovering and achieving goals via world models, 2021. URL https://arxiv.org/abs/2110.09514.
[17] Chang Chen, Yi-Fu Wu, Jaesik Yoon, and Sungjin Ahn. Transdreamer: Reinforcement learning with transformer world models, 2024. URL https://arxiv.org/abs/2202.09481.
[18] Anna Dawid and Yann LeCun. Introduction to latent variable energy-based models: a path toward autonomous machine intelligence. Journal of Statistical Mechanics: Theory and Experiment, 2024(10):104011, 2024.
[19] Mahmoud Assran, Quentin Duval, Ishan Misra, Piotr Bojanowski, Pascal Vincent, Michael Rabbat, Yann LeCun, and Nicolas Ballas. Self-supervised learning from images with a joint-embedding predictive architecture, 2023. URL https://arxiv.org/abs/2301.08243.
[20] Adrien Bardes, Jean Ponce, and Yann LeCun. Mc-jepa: A joint-embedding predictive architecture for self-supervised learning of motion and content features, 2023. URL https://arxiv.org/abs/2307.12698.
[21] Mido Assran, et, al. V-jepa 2: Self-supervised video models enable understanding, prediction and planning, 2025. URL https://arxiv.org/abs/2506.09985.
[22] Lucas Maes, Quentin Le Lidec, Damien Scieur, Yann LeCun, and Randall Balestriero. Leworldmodel: Stable end-to-end joint-embedding predictive architecture from pixels, 2026. URL https://arxiv.org/abs/2603.19312.
[23] Zhengcong Fei, Mingyuan Fan, and Junshi Huang. A-jepa: Joint-embedding predictive architecture can listen, 2024. URL https://arxiv.org/abs/2311.15830.
[24] Sergey Tulyakov, Ming-Yu Liu, Xiaodong Yang, and Jan Kautz. Mocogan: Decomposing motion and content for video generation, 2017. URL https://arxiv.org/abs/1707.04993.
[25] Masaki Saito, Eiichi Matsumoto, and Shunta Saito. Temporal generative adversarial nets with singular value clipping, 2017. URL https://arxiv.org/abs/1611.06624.
[26] Aidan Clark, Jeff Donahue, and Karen Simonyan. Adversarial video generation on complex datasets, 2019. URL https://arxiv.org/abs/1907.06571.
[27] Xin Ma, Yaohui Wang, Xinyuan Chen, Gengyun Jia, Ziwei Liu, Yuan-Fang Li, Cunjian Chen, and Yu Qiao. Latte: Latent diffusion transformer for video generation, 2025. URL https://arxiv.org/abs/2401.03048.
[28] Yuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang, Yaohui Wang, Yu Qiao, Maneesh Agrawala, Dahua Lin, and Bo Dai. Animatediff: Animate your personalized text-to-image diffusion models without specific tuning, 2024. URL https://arxiv.org/abs/2307.04725.
[29] Team Wan, et, al. Wan: Open and advanced large-scale video generative models, 2025. URL https://arxiv.org/abs/2503.20314.
[30] OpenAI. Sora 2. https://openai.com/sora, 09 2025. Accessed: 2026-04-08.
[31] Kuaishou. Kling 3.0. https://klingai.com/, 02 2026. Accessed: 2026-04-08.
[32] Google DeepMind. Veo 3. https://deepmind.google/technologies/veo/, 05 2025. Accessed: 2026-04-08.
[33] Runway. Gen-4. https://runwayml.com/, 2025. Accessed: 2026-04-08.
[34] Pika Labs. Pika 2.2. https://pika.art/, 02 2025. Released February 2025. Accessed: 2026-04-08.
[35] Russell Mendonca, Shikhar Bahl, and Deepak Pathak. Structured world models from human videos, 2023. URL https://arxiv.org/abs/2308.10901.
[36] Danijar Hafner, Timothy Lillicrap, Jimmy Ba, and Mohammad Norouzi. Dream to control: Learning behaviors by latent imagination, 2020. URL https://arxiv.org/abs/1912.01603.
[37] Shenyuan Gao, et, al. Dreamdojo: A generalist robot world model from large-scale human videos, 2026. URL https://arxiv.org/abs/2602.06949.
[38] Raktim Gautam Goswami, Amir Bar, David Fan, Tsung-Yen Yang, Gaoyue Zhou, Prashanth Krishnamurthy, Michael Rabbat, Farshad Khorrami, and Yann LeCun. World models for learning dexterous hand-object interactions from human videos, 2026. URL https://arxiv.org/abs/2512.13644.
[39] Siyuan Zhou, Yilun Du, Jiaben Chen, Yandong Li, Dit-Yan Yeung, and Chuang Gan. Robodreamer: Learning compositional world models for robot imagination, 2024. URL https://arxiv.org/abs/2404.12377.
[40] Fangqi Zhu, Hongtao Wu, Song Guo, Yuxiao Liu, Chilam Cheang, and Tao Kong. Irasim: A fine-grained world model for robot manipulation, 2025. URL https://arxiv.org/abs/2406.14540.
[41] Haiguang Wang, Daqi Liu, Hongwei Xie, Haisong Liu, Enhui Ma, Kaicheng Yu, Limin Wang, and Bing Wang. Mila: Multi-view intensive-fidelity long-term video generation world model for autonomous driving, 2025. URL https://arxiv.org/abs/2503.15875.
[42] Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, and Chelsea Finn. Ctrl-world: A controllable generative world model for robot manipulation, 2026. URL https://arxiv.org/abs/2510.10125.
[43] Yu Shang, Xin Zhang, Yinzhou Tang, Lei Jin, Chen Gao, Wei Wu, and Yong Li. Roboscape: Physics-informed embodied world model, 2025. URL https://arxiv.org/abs/2506.23135.
[44] Xiaowei Chi, et, al. Wow: Towards a world omniscient world model through embodied interaction, 2025. URL https://arxiv.org/abs/2509.22642.
[45] Carolina Higuera, Sergio Arnaud, Byron Boots, Mustafa Mukadam, Francois Robert Hogan, and Franziska Meier. Visuo-tactile world models, 2026. URL https://arxiv.org/abs/2602.06001.
[46] Wenlong Huang, Yu-Wei Chao, Arsalan Mousavian, Ming-Yu Liu, Dieter Fox, Kaichun Mo, and Li Fei-Fei. Point-world: Scaling 3d world models for in-the-wild robotic manipulation, 2026. URL https://arxiv.org/abs/2601.03782.

添加新批注
在作者公开此批注前,只有你和作者可见。
回复批注