Interactive World Simulator for Robot Policy Training and Evaluation
摘要
动作条件视频预测模型(世界模型)在机器人应用中展现出巨大潜力,但现有方法通常速度较慢且难以在长时间跨度内捕捉物理一致的交互。本文提出 Interactive World Simulator (IWS),一个从中等规模机器人交互数据集构建交互式世界模型的框架。该方法利用一致性模型进行图像解码和潜在空间动力学预测,实现快速稳定的物理交互模拟。实验中,学习到的世界模型产生交互一致的像素级预测,并在单块 RTX 4090 GPU 上以 15 FPS 的速度支持超过 10 分钟的稳定长时交互。该框架使可扩展的演示数据收集完全在世界模型内进行,以训练模仿学习策略。通过广泛的真实世界评估,研究发现世界模型生成数据训练的策略与同等数量真实数据训练的策略性能相当,且世界模拟器内与真实世界的策略性能存在强相关性。
技术细节
Consistency Model + CNN Autoencoder
CNN Encoder
Consistency Model Decoder
论文解读
哥伦比亚大学与丰田研究院联合发布交互式世界模拟器 IWS:支持 10 分钟以上稳定长时交互的世界模型
核心问题
动作条件视频预测模型在机器人领域具有重要应用价值,可用于规划、控制、策略引导和策略评估等任务。然而,现有方法面临两大核心挑战:
计算效率低下:现有模型通常依赖重型神经网络和多步扩散过程,导致推理速度缓慢。例如,基于扩散的方法需要多次迭代去噪才能生成一帧图像,难以满足实时交互需求。
长时稳定性差:由于累积预测误差,现有方法在长时间跨度(long-horizon)的自回归预测中容易出现不稳定,导致物理不一致的预测结果。这使得它们难以用于可扩展的策略训练数据生成和可复现的策略评估。
本文提出的 Interactive World Simulator 旨在解决这两个核心问题,实现高效、稳定的长时交互式世界模拟。
方法解剖
IWS 的核心创新在于采用两阶段训练策略,结合一致性模型的高效性和潜在空间预测的稳定性。
第一阶段:自编码器训练。研究使用 CNN 编码器将高维图像编码为紧凑的 2D 潜在表示,然后训练一致性模型解码器进行高保真图像重建。一致性模型的训练采用 Consistency Trajectory Model (CTM) 的稳定训练方法,通过对同一图像在不同噪声尺度下施加相同噪声,训练解码器从高噪声输入预测低噪声目标。
第二阶段:动力学模型训练。冻结自编码器参数后,研究在潜在空间训练动作条件动力学模型。与第一阶段类似,动力学模型也采用一致性模型架构,但关键区别在于仅对最后一帧施加完整噪声,使模型学习根据动作序列和历史上下文预测下一帧的潜在表示。动力学模型实例化为 3D 卷积块堆叠,结合 FiLM 调制和时空注意力机制。
其中 w(σ) 是噪声依赖权重,用于平衡不同噪声尺度的学习。
长时稳定性关键技术:为实现稳定的长时预测,研究采用了一个重要技巧——在训练时向观测上下文注入小噪声,使动力学模型对噪声上下文具有鲁棒性。在推理时,模型的预测将作为后续步骤的上下文,不可避免地带有噪声。因此,模型对噪声上下文的鲁棒性对于稳定的长时预测至关重要。
实验解剖
定性结果显示,IWS 在多个操作任务上的预测与真实交互高度一致,而基线方法(包括 DINO-WM、UVA、Dreamer 和 Cosmos)在长时预测中出现明显的物理不一致。
| 指标 | IWS (Ours) | DINO-WM | UVA | Dreamer | Cosmos |
|---|---|---|---|---|---|
| MSE ↓ | 0.005 | 0.028 | 0.023 | 0.012 | 0.019 |
| LPIPS ↓ | 0.051 | 0.270 | 0.272 | 0.163 | 0.224 |
| FID ↓ | 63.50 | 200.77 | 142.55 | 239.97 | 200.74 |
| PSNR ↑ | 25.82 | 17.79 | 17.87 | 20.81 | 18.91 |
| SSIM ↑ | 0.831 | 0.652 | 0.650 | 0.693 | 0.647 |
| UIQI ↑ | 0.960 | 0.875 | 0.884 | 0.919 | 0.883 |
| FVD ↓ | 243.20 | 1752.57 | 2213.29 | 1747.26 | 799.34 |
定量结果进一步验证了 IWS 的优越性。在所有评估指标上,IWS 均取得最佳性能:MSE 降低至 0.005(比第二好的 Dreamer 低 58%),LPIPS 降低至 0.051(比第二好的 Cosmos 低 77%),FID 降低至 63.50(比第二好的 UVA 低 55%)。这些结果表明 IWS 在像素级预测质量和物理一致性方面显著优于现有方法。
研究通过实验验证了世界模拟器数据的质量。图 5 展示了使用不同比例的真实数据和世界模拟器数据训练的策略性能。结果表明,使用 100% 世界模拟器数据训练的策略与使用 100% 真实数据训练的策略性能相当。对于 Diffusion Policy (DP),使用 100% 模拟器数据的平均任务得分为 87.9%,而使用 100% 真实数据为 90.3%。对于 ACT,使用模拟器数据为 76.2%,使用真实数据为 73.6%。
相关性分析是本文的重要贡献之一。图 7 展示了世界模拟器内策略性能与真实世界性能之间的强正相关性。这一发现表明,IWS 不仅可以用于数据生成,还可以作为策略评估的忠实代理,实现可复现的算法迭代和检查点选择。
总结与展望
本文提出的 Interactive World Simulator (IWS) 是一个高效、稳定的交互式世界模型框架,具有以下核心贡献:
高效稳定的长时模拟:通过结合一致性模型和潜在空间预测,IWS 在单块 RTX 4090 GPU 上以 15 FPS 的速度支持超过 10 分钟的稳定交互,显著优于现有方法。
高质量数据生成:世界模拟器生成的数据与真实数据质量相当,使用 100% 模拟器数据训练的策略性能与使用同等数量真实数据训练的策略相当。
可复现的策略评估:世界模拟器内与真实世界的策略性能存在强相关性,使其成为算法迭代和检查点选择的可靠代理。
未来方向:研究指出,未来工作可以探索将 IWS 扩展到更复杂的任务场景、更多样的机器人形态,以及与其他学习方法(如强化学习)的结合。此外,提高世界模型的泛化能力和物理理解的深度也是重要的研究方向。
引用信息
@article{wang2026interactive,
title={Interactive World Simulator for Robot Policy Training and Evaluation},
author={Wang, Yixuan and Syed, Rhythm and Wu, Fangyu and Zhang, Mengchao and Onol, Aykut and Barreiros, Jose and Nayyeri, Hooshang and Dear, Tony and Zhang, Huan and Li, Yunzhu},
journal={arXiv preprint arXiv:2603.08546},
year={2026}
}
本报告中的图片来源于原论文,仅供学术研究参考。
