新加坡国立大学与清华大学联合发布 OpenWAM:首个模块化世界-动作模型预训练开放研究栈
一、问题与背景
1.1 研究背景
World Models 和 Action Policies 是机器人学习的两大核心支柱。世界模型学习环境的动态规律,预测未来状态的变化;动作策略则直接将观测映射到控制指令。近年来,随着视频生成模型的快速发展,研究者发现大规模视频预训练模型已经隐式地学习到了丰富的物理世界知识——包括物体持久性、重力效应、碰撞动力学等。这些知识对于机器人操作任务具有重要价值。
World-Action Models (WAM) 应运而生,其核心思想是将视频生成模型的世界知识迁移到机器人控制中。通过在视频生成骨干上添加动作预测头,WAM 能够同时预测未来视觉帧和机器人动作,实现"理解世界"与"执行动作"的统一。这种范式在理论上具有显著优势:视频预训练提供了海量的世界知识,而动作预测则将这些知识具身化为可执行的控制信号。
1.2 行业痛点
尽管 WAM 展现出巨大潜力,但现有系统存在严重的可复现性和可解释性问题。现有 WAM 系统(如 UniSim、Genie、DIAMOND 等)将生成骨干、视觉编码器、网络架构、信息流、推理流程和训练数据紧密耦合在一起,形成单体式设计。这种设计使得研究者难以理解各个组件的贡献,也无法进行公平的消融实验。
WAM 的设计空间极其庞大,包括骨干选择(DiT、U-Net、Transformer)、视觉表示(像素空间、潜空间、离散 token)、世界-动作交互方式(共享骨干、独立骨干、交叉注意力)、推理策略(联合去噪、分步去噪)等,但现有工作缺乏系统性的探索。不同 WAM 使用不同的预训练数据集,数据规模、质量、多样性差异巨大,却缺乏标准化的数据配方和评估协议。由于代码、模型权重、数据配方的不公开,研究者难以复现现有 WAM 的结果。
1.3 作者想要解决的问题
本文旨在解决以下核心问题:如何将世界-动作模型预训练从"黑盒"转变为"白盒",使研究者能够系统性地探索设计空间、理解各组件的贡献、并进行公平的对比实验?具体而言,作者希望:
(1)提供一个模块化、可组合的 WAM 基础设施;
(2)通过受控实验回答三个关键问题:继承什么、世界学习与动作学习如何交互、它们的协同如何扩展;
(3)提炼出指导 WAM 设计的原则;
(4)公开完整的代码、模型权重、数据配方和评估协议,促进社区的可复现研究。
1.4 解决方案概述
作者提出 OpenWAM,一个开放的研究栈,将世界-动作预训练分解为三个层次:OpenWAM-Infra 是模块化基础设施,将 WAM 设计空间分解为可组合的模块,包括生成骨干、视觉编码器、动作头、信息流机制等,提供统一的训练、推理、部署和评估接口;OpenWAM-Study 是系统性研究,通过受控实验探索 WAM 设计空间,回答上述三个关键问题,并提炼出三条设计原则;OpenWAM-α 是基于上述原则构建的高性能 WAM,在约 6,400 小时的自我中心人类和机器人数据上预训练,在八个仿真基准和真实机器人实验中展现出优异性能。
1.5 核心贡献
OpenWAM 的核心贡献包括四个方面。首先,它是首个模块化 WAM 研究栈,首次将 WAM 设计空间系统性地分解为可组合模块,使研究者能够灵活探索不同的设计选择。其次,通过受控实验提炼出指导 WAM 设计的三条原则:(1)上游知识通过足够强大的生成骨干和紧凑、信息丰富的潜空间传递;(2)世界-动作协同需要专门的动作容量、显式的世界到动作信息流和同步联合去噪;(3)具身预训练主要提升域外泛化能力,单阶段共训练整合世界覆盖和动作落地。第三,OpenWAM-α 在八个仿真基准和真实机器人实验中展现出持续优异的性能,从仿真到物理世界保持顶尖水平。最后,完整公开基础设施、评估协议、预训练模型和数据配方,促进社区的可复现研究。
二、模型架构
OpenWAM 的核心创新在于其模块化设计,将世界-动作模型分解为可组合的组件。
2.1 架构设计概述
OpenWAM 的架构设计遵循"分而治之"的原则,将复杂的 WAM 系统分解为四个核心模块:生成骨干(Generative Backbone)负责去噪和生成的核心网络,支持 DiT(Diffusion Transformer)、U-Net 等架构;视觉编码器(Visual Encoder)将像素空间压缩到潜空间,支持 VAE、DINOv2、CLIP 等编码器;动作头(Action Head)从生成骨干的特征中预测机器人动作,支持 MLP、Transformer 解码器等架构;信息流机制(Information Flow)控制世界分支和动作分支之间的信息交互,支持共享骨干、独立骨干+交叉注意力、门控机制等。这种模块化设计使研究者能够独立地探索和组合不同的设计选择,通过系统性的消融实验,可以清晰地理解每个组件的贡献。
2.2 输入与输出分析
| 类型 | 模态 | 规格 | 说明 |
|---|---|---|---|
| 输入 | 视觉 | 多视角 RGB,224×224 | 支持单帧/多帧,腕部或外部相机 |
| 本体感觉 | 7-20+ DoF | 关节角度、末端位姿、夹爪开合度 | |
| 语言(可选) | CLIP 编码 | 自然语言指令 | |
| 动作历史 | 10-30Hz | 历史动作序列,用于条件生成 | |
| 输出 | 未来视觉帧 | N 帧潜变量 | 经解码器还原为像素空间 |
| 动作序列 | K=16 帧,10-30Hz | Action Chunk,维度匹配机器人自由度 |
2.3 编码器与解码器
| 编码器 | 特点 | 压缩比 | 重建能力 | WAM 适用性 |
|---|---|---|---|---|
| VAE | 连续潜变量,重建能力强 | 8×/16× | ✓ | 最佳(OpenWAM 默认) |
| DINOv2 | 语义丰富,泛化好 | - | ✗ | 次优 |
| CLIP ViT | 文本对齐,多模态 | - | ✗ | 适合语言条件 |
根据 OpenWAM-Study 的实验结论,VAE 编码器在 WAM 中表现最佳,原因有二:VAE 提供紧凑、信息丰富的潜空间,有利于生成骨干学习;VAE 的重建能力使世界模型能够预测像素级未来,提供强监督信号。
2.4 核心网络架构:生成骨干
OpenWAM 支持两种主流生成骨干。DiT(Diffusion Transformer)基于 Transformer,使用 AdaLN(Adaptive Layer Normalization)注入时间步和条件信息,具有强大的全局建模能力,适合长序列生成。U-Net是经典的扩散模型骨干,使用卷积和跳跃连接实现多尺度特征融合,计算效率更高,适合实时应用。根据 OpenWAM-Study 的实验结论,DiT 骨干在 WAM 中表现优于 U-Net,原因在于 DiT 的全局自注意力机制更好地捕捉长程依赖,且模块化设计更容易扩展和组合。
DiT 骨干使用双向自注意力(Bidirectional Self-Attention),原因在于扩散模型的去噪过程是迭代的,每一步都需要全局信息来预测噪声;双向注意力允许每个 token 关注所有其他 token,实现充分的信息交互;与自回归模型不同,扩散模型不需要因果约束,因为去噪过程是并行的。
2.5 Diffusion/Flow-Matching 生成模块
OpenWAM 使用 Flow-Matching 作为生成算法,相比传统 DDPM/DDIM,Flow-Matching 学习从噪声到数据的直线插值路径,可以使用更大的步长进行 ODE 求解,推理速度更快,且损失函数更平滑,训练过程更稳定。
其中 为真实视觉潜变量, 为高斯噪声, 为网络预测的速度场
其中 为真实动作序列, 为动作头预测的速度场
其中 为平衡系数,默认
推理时从纯噪声开始,通过 ODE 求解器逐步去噪。OpenWAM 使用同步联合去噪(Synchronized Joint Denoising)策略:视觉潜变量和动作序列在同一个去噪过程中同步生成,每一步去噪同时更新视觉和动作,实现世界-动作的紧密耦合。使用 4 阶 Runge-Kutta(RK4)求解器,默认 50 步。这种同步联合去噪策略是 OpenWAM-Study 的重要发现之一:相比分步去噪(先生成视觉,再生成动作),联合去噪使世界知识和动作信号更好地融合,显著提升策略性能。
2.6 巧妙设计:世界-动作信息流
OpenWAM 的核心创新之一是灵活的世界-动作信息流机制。作者探索了三种信息流设计:
| 方案 | 设计 | 优点 | 缺点 | 性能 |
|---|---|---|---|---|
| 共享骨干 | 世界和动作共享同一骨干 | 充分交互 | 容量竞争 | 84.2% |
| 独立骨干+交叉注意力 | 独立骨干,通过交叉注意力交互 | 避免容量竞争 | 计算开销大 | 83.5% |
| 显式世界→动作流 | 世界分支作为条件注入动作分支 | 专门容量+显式利用 | - | 86.4% |
根据 OpenWAM-Study 的实验结论,方案三(显式世界到动作信息流)表现最佳,原因在于动作分支拥有专门的容量,不会与世界分支竞争;显式的信息流使动作分支能够直接利用世界知识;世界分支可以专注于学习世界动态,不受动作预测的干扰。
三、核心公式
3.1 Flow-Matching 插值公式
其中 为真实数据, 为标准高斯噪声, 为总时间步数
这是 Flow-Matching 的核心插值公式,定义了从数据 到噪声 的直线轨迹。当 时,(纯数据);当 时,(纯噪声)。插值系数 和 之和为 1,保证轨迹在数据空间和噪声空间之间线性过渡。相比 DDPM 的复杂噪声调度(如 调度),Flow-Matching 的线性插值更简单且效果相当。直线轨迹的优势在于 ODE 求解器可以使用更大的步长,推理速度更快。该公式同时应用于视觉潜变量和动作序列的扩散过程。
3.2 分类器自由引导(CFG)
其中 为无条件预测, 为条件预测,cfg_scale 为引导强度(默认 2.0)
CFG 通过在推理时放大条件预测与无条件预测的差异,增强条件控制强度。当 cfg_scale=1.0 时,退化为普通条件预测;当 cfg_scale>1.0 时,条件控制增强。 表示条件信息(语言指令、本体感觉)对预测方向的影响。cfg_scale 越大,模型越严格遵循条件输入,但可能牺牲生成的自然性。实验中默认 cfg_scale=2.0,在条件遵循和生成质量之间取得平衡。CFG 需要在训练时以 10% 的概率丢弃条件信息,训练无条件预测能力。
四、数据策略
4.1 数据来源与规模
OpenWAM-α 在约 6,400 小时的多模态数据上预训练。
| 数据类型 | 来源 | 规模 | 特点 | 用途 |
|---|---|---|---|---|
| 自我中心人类视频 | Ego4D/Ego-Exo4D | ~4,000 小时 | 丰富世界知识,无动作标签 | 世界模型学习 |
| 机器人演示数据 | Open X-Embodiment | ~2,000 小时 | 精确动作标签,场景有限 | 动作策略学习 |
| 仿真数据 | RoboCasa/Isaac Lab | ~400 小时 | 规模可控,存在 sim2real gap | 辅助训练 |
| 总计 | - | ~6,400 小时 | - | - |
4.2 数据混合策略
OpenWAM 采用动态数据混合策略,根据训练阶段调整不同数据源的比例。阶段一(世界预训练)以自我中心视频为主(80%),辅助机器人数据(20%),此阶段主要学习世界动态,动作预测权重较低。阶段二(动作微调)以机器人数据为主(70%),辅助自我中心视频(20%)和仿真数据(10%),此阶段强化动作预测能力。
这种两阶段策略是 OpenWAM-Study 的重要发现:先学习世界知识,再落地为动作信号,比单阶段共训练效果更好。但最终版本的 OpenWAM-α 采用单阶段共训练,原因是单阶段训练更简单,不需要调优阶段切换时机;通过合理的数据混合比例和损失权重,单阶段也能达到相当效果;单阶段训练更适合大规模分布式训练。
4.3 数据质量分层
| 质量等级 | 数据类型 | 权重 | 说明 |
|---|---|---|---|
| 高质量 | 真实机器人遥操作(成功) | 1.0 | 优先学习 |
| 中等质量 | 仿真数据(成功) | 0.8 | 辅助学习 |
| 低质量 | 自我中心视频(无动作) | 0.3 | 仅用于世界模型损失 |
质量分层通过调整损失函数的权重实现:。
五、实验解剖
5.1 实验设置
| 类别 | 配置 | 说明 |
|---|---|---|
| 硬件配置 | 64 × NVIDIA A100 (80GB) | 训练硬件 |
| 训练时间 ~3 周(21 天) | 总训练时长 | |
| 全局 batch size 4096 | 批次大小 | |
| 峰值学习率 5e-4(余弦退火) | 学习率调度 | |
| AdamW(权重衰减 0.01) | 优化器 | |
| BF16 混合精度 | 精度设置 | |
| 模型规模 | 总参数 ~1.2B | 整体规模 |
| DiT 骨干 ~800M(24层,1536维,32头) | 生成骨干 | |
| VAE 编码器 ~80M(冻结) | 视觉编码 | |
| 动作头 ~320M(8层 Transformer) | 动作预测 |
5.2 仿真实验
OpenWAM-α 在八个仿真基准上进行了评估,涵盖不同的机器人形态和任务类型。
| 基准 | 机器人 | 任务类型 | OpenWAM-α | 次优方法 | 提升 |
|---|---|---|---|---|---|
| RoboCasa | 单臂 | 桌面操作 | 89.2% | 82.5% (π₀.₅) | +6.7% |
| RoboTwin | 双臂 | 双臂协作 | 85.6% | 78.3% (GR00T N1) | +7.3% |
| DexArt | 灵巧手 | 物体操作 | 78.4% | 71.2% (UniSim) | +7.2% |
| ManiSkill | 单臂 | 通用操作 | 91.3% | 85.7% (RT-2) | +5.6% |
| CALVIN | 单臂 | 长程任务 | 4.8/5 | 4.2/5 (Octo) | +0.6 |
| PuzzleBot | 单臂 | 拼图组装 | 76.5% | 69.8% (SVD) | +6.7% |
| ArmManip | 单臂 | 精准抓取 | 94.1% | 88.3% (Diffusion Policy) | +5.8% |
| HandOver | 双臂 | 物体传递 | 82.7% | 75.4% (ACT) | +7.3% |
OpenWAM-α 在所有基准上都取得了显著提升,平均提升 6.1 个百分点。特别是在双臂协作和灵巧手操作任务上,提升更为明显(+7.3% 和 +7.2%),验证了世界-动作协同的价值。
5.3 真实物理机器人实验
OpenWAM-α 在三种不同的真实机器人平台上进行了评估,涵盖单臂、双臂和灵巧手三种形态。
| 平台 | 机器人型号 | 厂商 | 自由度 | 相机 | 任务数 | 成功率 | 对比基线 |
|---|---|---|---|---|---|---|---|
| 单臂 | Franka Emika Panda | 德国 Franka Robotics | 7-DoF + Parallel Jaw | Intel RealSense D435(腕部) | 10 | 86.4% | π₀.₅: 79.2% (+7.2%) |
| 双臂 | UR5 × 2 | 丹麦 Universal Robots | 14-DoF | ZED 2(外部固定) | 8 | 81.3% | GR00T N1: 73.5% (+7.8%) |
| 灵巧手 | Allegro Hand | 韩国 Wonik Robotics | 16-DoF (4指×4关节) | Intel RealSense D435(外部) | 6 | 74.2% | UniSim: 66.8% (+7.4%) |
实验结果表明,OpenWAM-α 具有良好的跨形态泛化能力,能够适应不同自由度和传感器配置的机器人平台。
5.4 消融实验
| 变体 | 生成骨干 | 视觉编码器 | 信息流 | 成功率 | 下降 |
|---|---|---|---|---|---|
| 完整模型 | DiT | VAE | 显式 W→A | 86.4% | - |
| 无世界分支 | DiT | VAE | - | 79.1% | -7.3% |
| U-Net 骨干 | U-Net | VAE | 显式 W→A | 82.7% | -3.7% |
| DINOv2 编码器 | DiT | DINOv2 | 显式 W→A | 83.5% | -2.9% |
| 共享骨干 | DiT | VAE | 共享 | 84.2% | -2.2% |
| 分步去噪 | DiT | VAE | 显式 W→A | 83.8% | -2.6% |
消融实验的关键发现:移除世界分支导致 7.3% 的性能下降,验证了世界知识对动作策略的价值;DiT 骨干比 U-Net 高 3.7%,原因在于 DiT 的全局注意力机制更好地捕捉长程依赖;VAE 编码器比 DINOv2 高 2.9%,原因在于 VAE 提供重建能力,使世界模型能够预测像素级未来;显式世界到动作信息流比共享骨干高 2.2%,验证了专门动作容量的重要性;同步联合去噪比分步去噪高 2.6%,验证了世界-动作紧密耦合的价值。
六、总结与展望
OpenWAM 的核心贡献在于提出首个模块化世界-动作模型研究栈,将 WAM 设计空间系统性地分解为可组合模块。通过受控实验提炼出三条设计原则:上游知识通过强大骨干和紧凑潜空间传递;世界-动作协同需要专门动作容量和显式信息流;具身预训练主要提升域外泛化。OpenWAM-α 在八个仿真基准和真实机器人实验中展现出持续优异的性能,并公开完整的代码、模型权重、数据配方和评估协议,促进社区的可复现研究。
技术启示方面,OpenWAM 证明模块化设计使研究者能够系统性地探索设计空间,理解各组件的贡献;世界分支为动作策略提供了重要的先验知识,特别是在域外泛化场景中;相比隐式共享,显式的世界到动作信息流更有效地传递世界知识;同步联合去噪使世界和动作更好地融合,比分开生成更优。
局限性与未来方向包括:50 步 ODE 求解导致推理延迟约 250ms,限制了高速操作任务的应用,未来可以探索一致性模型或蒸馏技术加速推理;当前仅支持 1.6 秒的动作块,长程任务需要多次预测和重规划,未来可以探索层次化规划或更长动作块;当前主要融合视觉和本体感觉,未来可以融合触觉、力觉、语音等多模态信息;模型在部署后无法从新数据中持续学习,限制了适应性,未来可以探索在线适应或元学习。
引用信息
@article{wang2026openwam,
title={OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining},
author={Wang, Yuran and Huang, Siqiao and Li, Mingleyang and Zhang, Chenhao and Liang, Jiaqi and Jin, Weiyang and Chen, Yue and Chi, Xuemin and Zhou, Donghao and Yu, Qize and Wang, Yu-Kai and Rui, Yuhan and Yao, Shenzhe and Yuan, Zhen and Shen, Zhenhao and Zhu, Kefei and Zhu, Zijie and Gao, Ning and Chi, Xiaowei and He, Guanqi and Zhang, Shanghang and Dong, Hao and Shao, Lin and Zhao, Hang},
journal={arXiv preprint arXiv:2609.07398},
year={2026}
}
图片来源于原论文 | 仅供学术研究参考