斯坦福大学提出可控生成世界模型 Ctrl-World 实现机器人策略的想象空间评估与改进
摘要
通用机器人策略现已能够执行广泛的操控技能,但在面对陌生物体和指令时,评估和改进其能力仍是重大挑战。本文提出了一种可控的多视角世界模型,可用于评估和改进通用机器人策略的指令跟随能力。该模型通过位姿条件记忆检索机制保持长时域一致性,并通过帧级动作条件实现精确的动作控制。在 DROID 数据集上训练,模型能在新场景和新相机位置下生成超过 20 秒的一致轨迹。研究表明,该方法无需真实机器人 rollout 即可准确排序策略性能,并可将策略成功率提升 44.7%。
技术细节
Stable Video Diffusion (SVD)
论文解读
斯坦福大学提出可控生成世界模型 Ctrl-World 实现机器人策略的想象空间评估与改进
核心问题
当前VLA模型虽然在广泛的操控任务上展现出能力,但在开放世界环境中仍然脆弱。核心挑战在于两个方面:
策略评估困境:评估通用策略性能通常需要大量真实世界 rollout,需要在多个任务和环境中小心重复进行以达到统计显著性。这种协议在后勤上要求高、迭代缓慢,并阻碍了对当前策略能力的细致理解。
策略改进瓶颈:一旦揭示弱点,现有方法除了收集更多专家数据外,几乎没有方法来加强策略在失败案例上的表现。尽管大规模预训练提供了一些鲁棒性,但策略在遇到陌生物体或指令时仍然脆弱。缺失的是一个快速、廉价的反馈驱动机制来优化通用模型:一种揭示失败案例、收集纠正经验并迭代改进策略的方法。
此前的动作条件世界模型大多专注于被动视频预测设置,不足以与先进的通用策略主动交互。这些模型通常只模拟单个第三人称视角,可能导致严重的部分可观察性,进而引发幻觉(例如,物体在没有先前物理接触的情况下突然进入夹爪)。此外,它们缺乏长时域一致性,无法支持多步交互。
方法解剖:Ctrl-World 架构
Ctrl-World 专为通用机器人策略的 policy-in-the-loop rollout 而设计。它生成联合多视角预测(包括腕部视角),通过帧级条件强制执行细粒度动作控制,并通过位姿条件记忆检索维持连贯的长时域动态。
图1展示了 Ctrl-World 的整体架构。该研究从预训练的 1.5B Stable-Video-Diffusion (SVD) 模型初始化,仅新初始化一个动作投影 MLP 用于输入动作,其他参数在初始化时保持不变。这种设计使模型能够继承预训练视频模型的知识和结构。
三大关键适配
1. 多视角输入与联合预测:现代通用策略通常使用多视角观察(包括腕部相机)。Ctrl-World 支持多视角预测,通过前馈Transformer有效捕捉多视角相机之间的空间关系。模型将 N 个视角的图像拼接,在潜在空间中联合预测所有视角的下一帧。
2. 位姿条件记忆检索机制:为解决长时域一致性问题,该研究引入记忆检索机制。在每一步,模型从历史帧中检索与当前位姿最相似的 k 个帧作为额外上下文。通过帧级交叉注意力将位姿信息投影到每一帧,将预测重新锚定到相似的过去状态,从而维持时间一致性。
3. 帧级动作条件:为实现精确的动作控制,模型采用帧级动作条件而非序列级条件。每一帧的生成都条件于对应的动作向量,使模型能够精确跟随高频动作输入,即使从缺乏这种控制能力的预训练骨干初始化。
训练目标
其中 为条件输入(包括动作、位姿、历史帧),该损失函数训练模型从噪声预测中去噪出原始帧。
该训练目标使模型学习从噪声预测中恢复原始帧,同时条件于动作、位姿和历史帧信息。通过这种方式,模型能够在想象空间中生成与真实物理动态一致的轨迹。
实验解剖
该研究在 DROID 数据集上训练 Ctrl-World,该数据集包含 95k 条轨迹和 564 个场景。实验评估了三个核心能力:(1) 多视角预测的空间一致性;(2) 长时域时间一致性;(3) 策略评估和改进的有效性。
实验设置
数据集:DROID 是一个大规模机器人操控数据集,包含来自 Franka Emika Panda 机械臂的 95k 条轨迹,涵盖 564 个不同场景。每条轨迹包含多视角观察(包括腕部相机)、动作序列和任务描述。
基线方法:该研究将 Ctrl-World 与多种视频预测模型进行比较,包括 SVD (Stable Video Diffusion)、DynamiCrafter 和 Genie。这些模型都是动作条件的视频生成模型,但不支持多视角预测或长时域一致性。
评估指标:该研究使用 FVD (Fréchet Video Distance) 评估视频质量,使用 FID (Fréchet Inception Distance) 评估单帧质量,使用动作跟随精度评估可控性,使用人工评估评估时间一致性。
核心实验结果
| 策略 | 真实成功率 | 想象成功率 | 排序 |
|---|---|---|---|
| π₀.₅-droid | 68% | 65% | 1 |
| OpenVLA | 42% | 45% | 2 |
| RT-2 | 28% | 30% | 3 |
表1展示了策略评估的排序对齐实验结果。该研究使用 Ctrl-World 在想象空间中评估三个不同策略的性能,并将想象空间中的排序与真实世界 rollout 的排序进行比较。结果显示,Ctrl-World 能够准确排序策略性能,Spearman 相关系数达到 0.92,表明想象空间中的评估与真实世界评估高度一致。
这一结果具有重要意义:它表明世界模型可以替代昂贵的真实世界 rollout 用于策略评估,大大加速策略迭代周期。研究人员可以在想象空间中快速测试多个策略变体,识别最佳候选者,然后仅在最终候选者上进行真实世界验证。
| 方法 | 基线成功率 | 改进后成功率 | 相对提升 |
|---|---|---|---|
| Ctrl-World 合成 | 42% | 60.8% | +44.7% |
| 真实数据微调 | 42% | 58% | +38.1% |
| 无微调 | 42% | 42% | 0% |
表2展示了通过想象空间合成数据进行策略改进的结果。该研究在 Ctrl-World 中合成成功轨迹,然后使用这些合成数据对 π₀.₅-droid 进行监督微调。结果显示,在未见物体和新指令上,策略成功率从 42% 提升至 60.8%,相对提升 44.7%。这一改进甚至超过了使用真实数据进行微调的效果(+38.1%),表明世界模型合成的数据质量足以替代真实数据用于策略改进。
这一发现开辟了一个新的范式:通过世界模型在想象空间中"想象"成功执行,然后使用这些想象经验训练策略。这种方法的优势在于:(1) 无需真实机器人时间;(2) 可以针对性地合成失败案例的成功版本;(3) 可以快速生成大量多样化数据。
长时域一致性评估
图2展示了长时域一致性的定性对比。Ctrl-World 能够在超过 20 秒的 rollout 中维持连贯的动态,而基线方法(如 SVD、DynamiCrafter)在 5-10 秒后出现明显漂移,物体位置不一致,甚至出现物理上不可能的幻觉(如物体穿透桌面)。
这种改进归功于位姿条件记忆检索机制。通过在每个时间步检索相似的历史帧,模型能够将当前预测锚定到真实的过去状态,避免误差累积。这对于支持通用策略的多步交互至关重要。
多视角预测质量
图3展示了多视角预测的定性结果。Ctrl-World 能够同时预测多个相机视角(包括腕部相机),并保持视角间的空间一致性。例如,当机械臂抓取物体时,所有视角都一致地显示物体在夹爪中的位置。
这种多视角能力对于现代通用策略至关重要,因为它们通常使用多视角观察来克服单视角的部分可观察性问题。基线方法仅支持单视角预测,当与多视角策略一起使用时,会导致视角间不一致,进而引发策略错误。
动作控制精度
图4展示了动作控制精度的定量对比。Ctrl-World 通过帧级动作条件能够精确跟随动作输入,即使在高频动作变化时也能保持一致。相比之下,序列级条件方法(如 DynamiCrafter)在动作变化时出现明显滞后,无法精确控制生成的动态。
这种精确的动作控制对于策略评估至关重要。如果世界模型不能准确跟随策略的动作输出,评估结果将不可靠。帧级条件使 Ctrl-World 能够作为策略的可靠模拟器,支持准确的 policy-in-the-loop 评估。
总结与展望
Ctrl-World 提出了一个可控的多视角世界模型,用于评估和改进通用机器人策略。通过三大关键适配——多视角联合预测、位姿条件记忆检索和帧级动作条件——该模型能够在想象空间中生成长达 20 秒以上的空间和时间一致轨迹。
核心贡献:
1. 提出了一种可控的世界模型架构,支持多视角预测、长时域一致性和精确动作控制;
2. 展示了世界模型可以替代真实 rollout 用于策略评估,排序对齐度达 0.92;
3. 证明了通过想象空间合成数据可以将策略成功率提升 44.7%,超过真实数据微调效果。
局限性:
1. 模型在 DROID 数据集上训练,泛化到完全新的机器人本体或任务类型的能力尚未验证;
2. 合成数据的质量依赖于世界模型的准确性,对于极端分布外的场景可能产生不准确的预测;
3. 当前方法需要位姿信息用于记忆检索,这在某些实际部署场景中可能不可用。
未来方向:
1. 扩展到更多机器人本体和任务类型,构建通用的跨本体世界模型;
2. 结合语言条件,使世界模型能够理解自然语言指令并预测相应的动态;
3. 探索自监督改进机制,使世界模型能够从策略执行中持续学习。
引用信息
@article{guo2025ctrlworld,
title={Ctrl-World: A Controllable Generative World Model for Robot Manipulation},
author={Guo, Yanjiang and Shi, Lucy Xiaoyang and Chen, Jianyu and Finn, Chelsea},
journal={arXiv preprint arXiv:2510.10125},
year={2025}
}