robotics
OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining
Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu, Zijie Zhu, Ning Gao, Xiaowei Chi, Guanqi He, Shanghang Zhang, Hao Dong, Lin Shao, Hang Zhao新加坡国立大学、清华大学、北京大学、香港大学、浙江大学、香港中文大学、上海交通大学
摘要
世界-动作模型(World-Action Models, WAM)从视频生成先验中继承世界知识,并通过具身经验将其转化为可执行的控制信号。然而,现有系统是单体式的:生成骨干、视觉表示、架构、信息流、推理过程和训练数据紧密耦合,掩盖了哪些设计选择重要以及为什么重要。本文引入 OpenWAM,一个开放研究栈,将世界-动作预训练转化为受控实验程序。OpenWAM-Infra 将 WAM 设计空间分解为可组合模块,提供统一的训练、推理、部署和评估。在此基础上,OpenWAM-Study 通过受控实验研究三个问题:继承什么、世界学习与动作学习如何交互、以及它们的协同如何扩展;并提炼出三条原则。基于这些原则构建的 OpenWAM-α 在约 6,400 小时的自我中心人类和机器人数据上预训练,在八个仿真基准和真实机器人实验中展现出持续优异的性能。
World-Action ModelDiffusion PolicyFlow-MatchingModular DesignVideo GenerationEmbodied AI
技术细节
数据集
Ego4D/Ego-Exo4D (4000h)Open X-Embodiment (2000h)RoboCasa/Isaac Lab (400h)Total ~6400 hours
仿真平台
RoboCasaRoboTwinDexArtManiSkillCALVINPuzzleBotArmManipHandOver
测试机器人
Franka Emika Panda (7-DoFIntel RealSense D435)UR5×2 + Robotiq 2F-85 (ZED 2)Allegro Hand (16-DoFIntel RealSense D435)
模型骨架
DiT (Diffusion Transformer, 24 layers, hidden dim 1536, 32 heads, ~800M params)
编码器
VAE (Variational Autoencoder, ~80M params, frozen)
解码器
Transformer Decoder Action Head (8 layers, ~320M params)
论文深度解读
阅读完整解读本文包含详细的论文深度解读,涵盖模型架构、核心公式、数据策略、实验解剖等内容。