机器人基础模型arXiv preprint2025

Interactive World Simulator for Robot Policy Training and Evaluation

Yixuan Wang, Rhythm Syed, Fangyu Wu, Mengchao Zhang, Aykut Onol, Jose Barreiros, Hooshang Nayyeri, Tony Dear, Huan Zhang, Yunzhu Li et al.Stanford University

摘要

动作条件视频预测模型(世界模型)在机器人应用中展现出巨大潜力,但现有方法通常速度较慢且难以在长时间跨度内捕捉物理一致的交互。本文提出 Interactive World Simulator (IWS),一个从中等规模机器人交互数据集构建交互式世界模型的框架。该方法利用一致性模型进行图像解码和潜在空间动力学预测,实现快速稳定的物理交互模拟。实验中,学习到的世界模型产生交互一致的像素级预测,并在单块 RTX 4090 GPU 上以 15 FPS 的速度支持超过 10 分钟的稳定长时交互。该框架使可扩展的演示数据收集完全在世界模型内进行,以训练模仿学习策略。通过广泛的真实世界评估,研究发现世界模型生成数据训练的策略与同等数量真实数据训练的策略性能相当,且世界模拟器内与真实世界的策略性能存在强相关性。

IWSInteractive World Simulator世界模型一致性模型潜在空间动作条件视频预测模仿学习机器人策略训练长时交互数据生成

技术细节

数据集
Open X-EmbodimentDROID
仿真平台
测试机器人
模型骨架

Consistency Model + CNN Autoencoder

编码器

CNN Encoder

解码器

Consistency Model Decoder

论文解读

哥伦比亚大学与丰田研究院联合发布交互式世界模拟器 IWS:支持 10 分钟以上稳定长时交互的世界模型

文章名:Interactive World Simulator for Robot Policy Training and Evaluation
作者:Yixuan Wang, Rhythm Syed, Fangyu Wu, Mengchao Zhang, Aykut Onol, Jose Barreiros, Hooshang Nayyeri, Tony Dear, Huan Zhang, Yunzhu Li
机构:Columbia University, Toyota Research Institute, Amazon, University of Illinois Urbana-Champaign
arXiv:2603.08546
摘要
动作条件视频预测模型(通常称为世界模型)在机器人应用中展现出巨大潜力,但现有方法通常速度较慢,且难以在长时间跨度内捕捉物理一致的交互,限制了其在可扩展机器人策略训练和评估中的实用性。本文提出 Interactive World Simulator (IWS),一个从中等规模机器人交互数据集构建交互式世界模型的框架。该方法利用一致性模型进行图像解码和潜在空间动力学预测,实现快速稳定的物理交互模拟。实验中,学习到的世界模型产生交互一致的像素级预测,并在单块 RTX 4090 GPU 上以 15 FPS 的速度支持超过 10 分钟的稳定长时交互。该框架使可扩展的演示数据收集完全在世界模型内进行,以训练最先进的模仿学习策略。通过广泛的真实世界评估,涉及刚性物体、柔性物体、物体堆及其交互的多样化任务,研究发现世界模型生成数据训练的策略与同等数量真实数据训练的策略性能相当。此外,研究还观察到世界模型内与真实世界中策略性能之间存在强相关性。

核心问题

动作条件视频预测模型在机器人领域具有重要应用价值,可用于规划、控制、策略引导和策略评估等任务。然而,现有方法面临两大核心挑战:

计算效率低下:现有模型通常依赖重型神经网络和多步扩散过程,导致推理速度缓慢。例如,基于扩散的方法需要多次迭代去噪才能生成一帧图像,难以满足实时交互需求。

长时稳定性差:由于累积预测误差,现有方法在长时间跨度(long-horizon)的自回归预测中容易出现不稳定,导致物理不一致的预测结果。这使得它们难以用于可扩展的策略训练数据生成和可复现的策略评估。

本文提出的 Interactive World Simulator 旨在解决这两个核心问题,实现高效、稳定的长时交互式世界模拟。

方法解剖

IWS 方法概览
图 2:方法概览。模型训练分两个阶段进行。第一阶段,训练一个自编码器,使用 CNN 编码器 E_φ 和一致性模型解码器 D_θ 将 RGB 观测映射到紧凑的 2D 潜在空间表示,实现高效高保真重建。第二阶段,冻结自编码器,训练动作条件一致性模型 F_ψ 预测未来潜在帧。

IWS 的核心创新在于采用两阶段训练策略,结合一致性模型的高效性和潜在空间预测的稳定性。

第一阶段:自编码器训练。研究使用 CNN 编码器将高维图像编码为紧凑的 2D 潜在表示,然后训练一致性模型解码器进行高保真图像重建。一致性模型的训练采用 Consistency Trajectory Model (CTM) 的稳定训练方法,通过对同一图像在不同噪声尺度下施加相同噪声,训练解码器从高噪声输入预测低噪声目标。

第二阶段:动力学模型训练。冻结自编码器参数后,研究在潜在空间训练动作条件动力学模型。与第一阶段类似,动力学模型也采用一致性模型架构,但关键区别在于仅对最后一帧施加完整噪声,使模型学习根据动作序列和历史上下文预测下一帧的潜在表示。动力学模型实例化为 3D 卷积块堆叠,结合 FiLM 调制和时空注意力机制。

自编码器损失:
动力学损失:

其中 w(σ) 是噪声依赖权重,用于平衡不同噪声尺度的学习。

长时稳定性关键技术:为实现稳定的长时预测,研究采用了一个重要技巧——在训练时向观测上下文注入小噪声,使动力学模型对噪声上下文具有鲁棒性。在推理时,模型的预测将作为后续步骤的上下文,不可避免地带有噪声。因此,模型对噪声上下文的鲁棒性对于稳定的长时预测至关重要。

实验解剖

定性比较
图 3:长时动作条件视频预测的定性比较。研究将 IWS 与最先进的动作条件视频预测模型在多个操作任务上进行比较。(a) Pile Sweeping 任务的中间预测帧展示了长时展开行为,基线方法表现出不准确的动力学、机器人姿势和物体位置。(b) IWS 在多个任务上的预测与真实交互高度一致。

定性结果显示,IWS 在多个操作任务上的预测与真实交互高度一致,而基线方法(包括 DINO-WM、UVA、DreamerCosmos)在长时预测中出现明显的物理不一致。

表 I:视频预测性能的定量比较。研究在涉及刚性物体、柔性物体、铰接物体和物体堆的多样化操作任务上定量评估最先进的动作条件视频预测模型。表格报告所有任务的聚合结果。
指标IWS (Ours)DINO-WMUVADreamerCosmos
MSE ↓0.0050.0280.0230.0120.019
LPIPS ↓0.0510.2700.2720.1630.224
FID ↓63.50200.77142.55239.97200.74
PSNR ↑25.8217.7917.8720.8118.91
SSIM ↑0.8310.6520.6500.6930.647
UIQI ↑0.9600.8750.8840.9190.883
FVD ↓243.201752.572213.291747.26799.34

定量结果进一步验证了 IWS 的优越性。在所有评估指标上,IWS 均取得最佳性能:MSE 降低至 0.005(比第二好的 Dreamer 低 58%),LPIPS 降低至 0.051(比第二好的 Cosmos 低 77%),FID 降低至 63.50(比第二好的 UVA 低 55%)。这些结果表明 IWS 在像素级预测质量和物理一致性方面显著优于现有方法。

遥操作界面
图 4:与世界模拟器实时交互的遥操作界面。研究构建了一个运动学遥操作设备,允许用户通过 Interactive World Simulator 控制机器人动作。左列显示用户通过遥操作设备发出命令(如向前移动、打开夹爪、提升末端执行器)。右列显示世界模拟器中的对应渲染,与真实世界渲染非常接近,但实际上桌子上没有杯子或盘子。这一示例展示了世界模拟器的沉浸式体验。
数据生成
图 5:使用真实世界数据和世界模拟器数据的混合训练模仿策略。"WS %"表示来自世界模拟器的数据百分比,"Real %"表示来自真实世界的数据百分比。从左到右,混合比例从 100% 世界模拟器数据到 100% 真实世界数据。每个策略和数据混合使用总共 100 个训练片段。

研究通过实验验证了世界模拟器数据的质量。图 5 展示了使用不同比例的真实数据和世界模拟器数据训练的策略性能。结果表明,使用 100% 世界模拟器数据训练的策略与使用 100% 真实数据训练的策略性能相当。对于 Diffusion Policy (DP),使用 100% 模拟器数据的平均任务得分为 87.9%,而使用 100% 真实数据为 90.3%。对于 ACT,使用模拟器数据为 76.2%,使用真实数据为 73.6%。

数据质量
图 6:数据缩放对策略性能的影响。研究比较了在不同大小数据集(从 5 到 100 个专家演示片段)上训练的 ACT 和 DP 性能。对于每种数据大小,使用 100% MuJoCo 数据或 100% 世界模拟器数据训练策略。策略性能随着演示数量的增加而一致提升,表明使用世界模拟器数据时策略训练的缩放行为相似。
相关性分析
图 7:世界模拟器中策略性能与真实世界性能之间的相关性。真实世界任务性能相对于策略在世界模拟器中的对应性能绘制。每个点对应一个训练策略在两种环境下的相同设置评估。观察到强正相关性,表明世界模拟器可以作为真实世界的忠实代理。

相关性分析是本文的重要贡献之一。图 7 展示了世界模拟器内策略性能与真实世界性能之间的强正相关性。这一发现表明,IWS 不仅可以用于数据生成,还可以作为策略评估的忠实代理,实现可复现的算法迭代和检查点选择。

总结与展望

本文提出的 Interactive World Simulator (IWS) 是一个高效、稳定的交互式世界模型框架,具有以下核心贡献:

高效稳定的长时模拟:通过结合一致性模型和潜在空间预测,IWS 在单块 RTX 4090 GPU 上以 15 FPS 的速度支持超过 10 分钟的稳定交互,显著优于现有方法。

高质量数据生成:世界模拟器生成的数据与真实数据质量相当,使用 100% 模拟器数据训练的策略性能与使用同等数量真实数据训练的策略相当。

可复现的策略评估:世界模拟器内与真实世界的策略性能存在强相关性,使其成为算法迭代和检查点选择的可靠代理。

未来方向:研究指出,未来工作可以探索将 IWS 扩展到更复杂的任务场景、更多样的机器人形态,以及与其他学习方法(如强化学习)的结合。此外,提高世界模型的泛化能力和物理理解的深度也是重要的研究方向。

引用信息

@article{wang2026interactive,
  title={Interactive World Simulator for Robot Policy Training and Evaluation},
  author={Wang, Yixuan and Syed, Rhythm and Wu, Fangyu and Zhang, Mengchao and Onol, Aykut and Barreiros, Jose and Nayyeri, Hooshang and Dear, Tony and Zhang, Huan and Li, Yunzhu},
  journal={arXiv preprint arXiv:2603.08546},
  year={2026}
}

相关公司(1)

京ICP备2026064258号-1