机器人

斯坦福大学提出可控生成世界模型 Ctrl-World 实现机器人策略的想象空间评估与改进

2025-10-110 阅读15 分钟阅读

通用机器人策略评估和改进面临重大挑战。本文提出 Ctrl-World,一种可控的多视角世界模型,通过位姿条件记忆检索和帧级动作条件,在想象空间中实现超过20秒的一致轨迹生成。该方法无需真实机器人 rollout 即可准确排序策略性能(Spearman 相关系数 0.92),并可通过合成成功轨迹将策略成功率提升 44.7%。

斯坦福大学提出可控生成世界模型 Ctrl-World 实现机器人策略的想象空间评估与改进

斯坦福大学 Chelsea Finn 团队提出 Ctrl-World,一种专为通用机器人策略设计的可控生成世界模型。

核心创新

Ctrl-World 通过三大关键适配实现可控、时间一致的世界模型:

  • 多视角输入与联合预测:支持多视角观察(包括腕部相机),通过前馈 Transformer 捕捉视角间空间关系
  • 位姿条件记忆检索机制:从历史帧中检索相似状态,通过帧级交叉注意力将预测锚定到过去状态,维持长时域一致性
  • 帧级动作条件:每帧生成条件于对应动作向量,实现精确的高频动作控制
  • 实验亮点

  • 在 DROID 数据集(95k 轨迹,564 场景)上训练
  • 生成超过 20 秒的空间和时间一致轨迹
  • 策略评估排序与真实 rollout 高度一致(Spearman ρ = 0.92)
  • 通过想象空间合成数据将 π₀.₅-droid 成功率提升 44.7%
  • 意义

    Ctrl-World 开辟了新范式:通过世界模型在想象空间中"想象"成功执行,然后使用这些想象经验训练策略,无需真实机器人时间即可改进策略性能。

    论文链接:[arXiv:2510.10125](https://arxiv.org/abs/2510.10125)

    评论 (0)

    暂无评论,来抢沙发

    京ICP备2026064258号-1