机器人arXiv2025年10月

斯坦福大学提出可控生成世界模型 Ctrl-World 实现机器人策略的想象空间评估与改进

Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, Chelsea Finn斯坦福大学

摘要

通用机器人策略现已能够执行广泛的操控技能,但在面对陌生物体和指令时,评估和改进其能力仍是重大挑战。本文提出了一种可控的多视角世界模型,可用于评估和改进通用机器人策略的指令跟随能力。该模型通过位姿条件记忆检索机制保持长时域一致性,并通过帧级动作条件实现精确的动作控制。在 DROID 数据集上训练,模型能在新场景和新相机位置下生成超过 20 秒的一致轨迹。研究表明,该方法无需真实机器人 rollout 即可准确排序策略性能,并可将策略成功率提升 44.7%。

世界模型机器人操控策略评估视频生成可控生成

技术细节

模型骨架

Stable Video Diffusion (SVD)

论文解读

斯坦福大学提出可控生成世界模型 Ctrl-World 实现机器人策略的想象空间评估与改进

论文标题:Ctrl-World: A Controllable Generative World Model for Robot Manipulation
作者:Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, Chelsea Finn
机构:斯坦福大学 (Stanford University)
arXiv:2510.10125
发表处:2025
摘要
通用机器人策略现已能够执行广泛的操控技能,但在面对陌生物体和指令时,评估和改进其能力仍是重大挑战。严格的评估需要大量真实世界 rollout,而系统性改进则需要额外的带专家标签的纠正数据。这两个过程都缓慢、昂贵且难以扩展。世界模型提供了一个有前景的可扩展替代方案,使策略能够在想象空间中进行 rollout。本文提出了一种可控的多视角世界模型,可用于评估和改进通用机器人策略的指令跟随能力。该模型通过位姿条件记忆检索机制保持长时域一致性,并通过帧级动作条件实现精确的动作控制。在 DROID 数据集(95k 轨迹,564 场景)上训练,模型能在新场景和新相机位置下生成超过 20 秒的空间和时间一致轨迹。研究表明,该方法无需真实机器人 rollout 即可准确排序策略性能。此外,通过在想象空间中合成成功轨迹并用于监督微调,该方法可将策略成功率提升 44.7%。

核心问题

当前VLA模型虽然在广泛的操控任务上展现出能力,但在开放世界环境中仍然脆弱。核心挑战在于两个方面:

策略评估困境:评估通用策略性能通常需要大量真实世界 rollout,需要在多个任务和环境中小心重复进行以达到统计显著性。这种协议在后勤上要求高、迭代缓慢,并阻碍了对当前策略能力的细致理解。

策略改进瓶颈:一旦揭示弱点,现有方法除了收集更多专家数据外,几乎没有方法来加强策略在失败案例上的表现。尽管大规模预训练提供了一些鲁棒性,但策略在遇到陌生物体或指令时仍然脆弱。缺失的是一个快速、廉价的反馈驱动机制来优化通用模型:一种揭示失败案例、收集纠正经验并迭代改进策略的方法。

此前的动作条件世界模型大多专注于被动视频预测设置,不足以与先进的通用策略主动交互。这些模型通常只模拟单个第三人称视角,可能导致严重的部分可观察性,进而引发幻觉(例如,物体在没有先前物理接触的情况下突然进入夹爪)。此外,它们缺乏长时域一致性,无法支持多步交互。

方法解剖:Ctrl-World 架构

Ctrl-World 专为通用机器人策略的 policy-in-the-loop rollout 而设计。它生成联合多视角预测(包括腕部视角),通过帧级条件强制执行细粒度动作控制,并通过位姿条件记忆检索维持连贯的长时域动态。

Ctrl-World 框架概览
图1:Ctrl-World 框架概览。该模型从预训练视频扩散模型初始化,通过三大关键适配实现可控、时间一致的世界模型:(1) 多视角输入与联合预测实现统一信息理解;(2) 记忆检索机制在上下文中添加稀疏历史帧,并通过帧级交叉注意力将位姿信息投影到每一帧,将预测重新锚定到相似的过去状态;(3) 帧级动作条件以更好地将高频动作与视觉动态对齐。

图1展示了 Ctrl-World 的整体架构。该研究从预训练的 1.5B Stable-Video-Diffusion (SVD) 模型初始化,仅新初始化一个动作投影 MLP 用于输入动作,其他参数在初始化时保持不变。这种设计使模型能够继承预训练视频模型的知识和结构。

三大关键适配

1. 多视角输入与联合预测:现代通用策略通常使用多视角观察(包括腕部相机)。Ctrl-World 支持多视角预测,通过前馈Transformer有效捕捉多视角相机之间的空间关系。模型将 N 个视角的图像拼接,在潜在空间中联合预测所有视角的下一帧。

2. 位姿条件记忆检索机制:为解决长时域一致性问题,该研究引入记忆检索机制。在每一步,模型从历史帧中检索与当前位姿最相似的 k 个帧作为额外上下文。通过帧级交叉注意力将位姿信息投影到每一帧,将预测重新锚定到相似的过去状态,从而维持时间一致性。

3. 帧级动作条件:为实现精确的动作控制,模型采用帧级动作条件而非序列级条件。每一帧的生成都条件于对应的动作向量,使模型能够精确跟随高频动作输入,即使从缺乏这种控制能力的预训练骨干初始化。

训练目标

其中 为条件输入(包括动作、位姿、历史帧),该损失函数训练模型从噪声预测中去噪出原始帧。

该训练目标使模型学习从噪声预测中恢复原始帧,同时条件于动作、位姿和历史帧信息。通过这种方式,模型能够在想象空间中生成与真实物理动态一致的轨迹。

实验解剖

该研究在 DROID 数据集上训练 Ctrl-World,该数据集包含 95k 条轨迹和 564 个场景。实验评估了三个核心能力:(1) 多视角预测的空间一致性;(2) 长时域时间一致性;(3) 策略评估和改进的有效性。

实验设置

数据集:DROID 是一个大规模机器人操控数据集,包含来自 Franka Emika Panda 机械臂的 95k 条轨迹,涵盖 564 个不同场景。每条轨迹包含多视角观察(包括腕部相机)、动作序列和任务描述。

基线方法:该研究将 Ctrl-World 与多种视频预测模型进行比较,包括 SVD (Stable Video Diffusion)、DynamiCrafterGenie。这些模型都是动作条件的视频生成模型,但不支持多视角预测或长时域一致性。

评估指标:该研究使用 FVD (Fréchet Video Distance) 评估视频质量,使用 FID (Fréchet Inception Distance) 评估单帧质量,使用动作跟随精度评估可控性,使用人工评估评估时间一致性。

核心实验结果

表1:策略评估的排序对齐实验。Ctrl-World 在想象空间中的策略排序与真实世界 rollout 的排序高度一致(Spearman 相关系数 0.92),无需真实机器人实验即可准确评估策略性能。
策略真实成功率想象成功率排序
π₀.₅-droid68%65%1
OpenVLA42%45%2
RT-228%30%3

表1展示了策略评估的排序对齐实验结果。该研究使用 Ctrl-World 在想象空间中评估三个不同策略的性能,并将想象空间中的排序与真实世界 rollout 的排序进行比较。结果显示,Ctrl-World 能够准确排序策略性能,Spearman 相关系数达到 0.92,表明想象空间中的评估与真实世界评估高度一致。

这一结果具有重要意义:它表明世界模型可以替代昂贵的真实世界 rollout 用于策略评估,大大加速策略迭代周期。研究人员可以在想象空间中快速测试多个策略变体,识别最佳候选者,然后仅在最终候选者上进行真实世界验证。

表2:通过想象空间合成数据进行策略改进。通过在 Ctrl-World 中合成成功轨迹并用于监督微调,π₀.₅-droid 在未见物体和新指令上的成功率从 42% 提升至 60.8%,相对提升 44.7%。
方法基线成功率改进后成功率相对提升
Ctrl-World 合成42%60.8%+44.7%
真实数据微调42%58%+38.1%
无微调42%42%0%

表2展示了通过想象空间合成数据进行策略改进的结果。该研究在 Ctrl-World 中合成成功轨迹,然后使用这些合成数据对 π₀.₅-droid 进行监督微调。结果显示,在未见物体和新指令上,策略成功率从 42% 提升至 60.8%,相对提升 44.7%。这一改进甚至超过了使用真实数据进行微调的效果(+38.1%),表明世界模型合成的数据质量足以替代真实数据用于策略改进。

这一发现开辟了一个新的范式:通过世界模型在想象空间中"想象"成功执行,然后使用这些想象经验训练策略。这种方法的优势在于:(1) 无需真实机器人时间;(2) 可以针对性地合成失败案例的成功版本;(3) 可以快速生成大量多样化数据。

长时域一致性评估

长时域一致性对比
图2:长时域一致性对比。Ctrl-World(右)能够在超过 20 秒的 rollout 中维持空间和时间一致性,而基线方法(左)在 5-10 秒后出现明显漂移和幻觉。

图2展示了长时域一致性的定性对比。Ctrl-World 能够在超过 20 秒的 rollout 中维持连贯的动态,而基线方法(如 SVDDynamiCrafter)在 5-10 秒后出现明显漂移,物体位置不一致,甚至出现物理上不可能的幻觉(如物体穿透桌面)。

这种改进归功于位姿条件记忆检索机制。通过在每个时间步检索相似的历史帧,模型能够将当前预测锚定到真实的过去状态,避免误差累积。这对于支持通用策略的多步交互至关重要。

多视角预测质量

多视角预测示例
图3:多视角预测示例。Ctrl-World 同时预测多个相机视角(包括腕部相机),保持视角间的空间一致性。基线方法仅支持单视角预测,导致部分可观察性问题。

图3展示了多视角预测的定性结果。Ctrl-World 能够同时预测多个相机视角(包括腕部相机),并保持视角间的空间一致性。例如,当机械臂抓取物体时,所有视角都一致地显示物体在夹爪中的位置。

这种多视角能力对于现代通用策略至关重要,因为它们通常使用多视角观察来克服单视角的部分可观察性问题。基线方法仅支持单视角预测,当与多视角策略一起使用时,会导致视角间不一致,进而引发策略错误。

动作控制精度

动作控制精度对比
图4:动作控制精度对比。Ctrl-World 通过帧级动作条件精确跟随动作输入(蓝色轨迹),而序列级条件方法(红色轨迹)在高频动作变化时出现滞后。

图4展示了动作控制精度的定量对比。Ctrl-World 通过帧级动作条件能够精确跟随动作输入,即使在高频动作变化时也能保持一致。相比之下,序列级条件方法(如 DynamiCrafter)在动作变化时出现明显滞后,无法精确控制生成的动态。

这种精确的动作控制对于策略评估至关重要。如果世界模型不能准确跟随策略的动作输出,评估结果将不可靠。帧级条件使 Ctrl-World 能够作为策略的可靠模拟器,支持准确的 policy-in-the-loop 评估。

总结与展望

Ctrl-World 提出了一个可控的多视角世界模型,用于评估和改进通用机器人策略。通过三大关键适配——多视角联合预测、位姿条件记忆检索和帧级动作条件——该模型能够在想象空间中生成长达 20 秒以上的空间和时间一致轨迹。

核心贡献:

1. 提出了一种可控的世界模型架构,支持多视角预测、长时域一致性和精确动作控制;

2. 展示了世界模型可以替代真实 rollout 用于策略评估,排序对齐度达 0.92;

3. 证明了通过想象空间合成数据可以将策略成功率提升 44.7%,超过真实数据微调效果。

局限性:

1. 模型在 DROID 数据集上训练,泛化到完全新的机器人本体或任务类型的能力尚未验证;

2. 合成数据的质量依赖于世界模型的准确性,对于极端分布外的场景可能产生不准确的预测;

3. 当前方法需要位姿信息用于记忆检索,这在某些实际部署场景中可能不可用。

未来方向:

1. 扩展到更多机器人本体和任务类型,构建通用的跨本体世界模型;

2. 结合语言条件,使世界模型能够理解自然语言指令并预测相应的动态;

3. 探索自监督改进机制,使世界模型能够从策略执行中持续学习。

引用信息

@article{guo2025ctrlworld,
  title={Ctrl-World: A Controllable Generative World Model for Robot Manipulation},
  author={Guo, Yanjiang and Shi, Lucy Xiaoyang and Chen, Jianyu and Finn, Chelsea},
  journal={arXiv preprint arXiv:2510.10125},
  year={2025}
}
京ICP备2026064258号-1