新加坡国立大学与清华大学联合发布 OpenWAM:首个模块化世界-动作模型预训练开放研究栈

新加坡国立大学与清华大学联合发布 OpenWAM:首个模块化世界-动作模型预训练开放研究栈

文章名:OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining
作者:Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu, Zijie Zhu, Ning Gao, Xiaowei Chi, Guanqi He, Shanghang Zhang, Hao Dong, Lin Shao, Hang Zhao
机构:新加坡国立大学、清华大学、北京大学、香港大学、浙江大学、香港中文大学、上海交通大学等
摘要
World-Action Models (WAM) 从视频生成先验中继承世界知识,并通过具身经验将其转化为可执行的控制信号。然而,现有系统是单体式的:生成骨干、视觉表示、架构、信息流、推理过程和训练数据紧密耦合,掩盖了哪些设计选择重要以及为什么重要。本文引入 OpenWAM,一个开放研究栈,将世界-动作预训练转化为受控实验程序。OpenWAM-Infra 将 WAM 设计空间分解为可组合模块,提供统一的训练、推理、部署和评估。在此基础上,OpenWAM-Study 通过受控实验研究三个问题:继承什么、世界学习与动作学习如何交互、以及它们的协同如何扩展;并提炼出三条原则。基于这些原则构建的 OpenWAM-α 在约 6,400 小时的自我中心人类和机器人数据上预训练,在八个仿真基准和真实机器人实验中展现出持续优异的性能。

一、问题与背景

1.1 研究背景

World Models 和 Action Policies 是机器人学习的两大核心支柱。世界模型学习环境的动态规律,预测未来状态的变化;动作策略则直接将观测映射到控制指令。近年来,随着视频生成模型的快速发展,研究者发现大规模视频预训练模型已经隐式地学习到了丰富的物理世界知识——包括物体持久性、重力效应、碰撞动力学等。这些知识对于机器人操作任务具有重要价值。

World-Action Models (WAM) 应运而生,其核心思想是将视频生成模型的世界知识迁移到机器人控制中。通过在视频生成骨干上添加动作预测头,WAM 能够同时预测未来视觉帧和机器人动作,实现"理解世界"与"执行动作"的统一。这种范式在理论上具有显著优势:视频预训练提供了海量的世界知识,而动作预测则将这些知识具身化为可执行的控制信号。

1.2 行业痛点

尽管 WAM 展现出巨大潜力,但现有系统存在严重的可复现性和可解释性问题。现有 WAM 系统(如 UniSim、Genie、DIAMOND 等)将生成骨干、视觉编码器、网络架构、信息流、推理流程和训练数据紧密耦合在一起,形成单体式设计。这种设计使得研究者难以理解各个组件的贡献,也无法进行公平的消融实验。

WAM 的设计空间极其庞大,包括骨干选择(DiT、U-Net、Transformer)、视觉表示(像素空间、潜空间、离散 token)、世界-动作交互方式(共享骨干、独立骨干、交叉注意力)、推理策略(联合去噪、分步去噪)等,但现有工作缺乏系统性的探索。不同 WAM 使用不同的预训练数据集,数据规模、质量、多样性差异巨大,却缺乏标准化的数据配方和评估协议。由于代码、模型权重、数据配方的不公开,研究者难以复现现有 WAM 的结果。

1.3 作者想要解决的问题

本文旨在解决以下核心问题:如何将世界-动作模型预训练从"黑盒"转变为"白盒",使研究者能够系统性地探索设计空间、理解各组件的贡献、并进行公平的对比实验?具体而言,作者希望:

(1)提供一个模块化、可组合的 WAM 基础设施;
(2)通过受控实验回答三个关键问题:继承什么、世界学习与动作学习如何交互、它们的协同如何扩展;
(3)提炼出指导 WAM 设计的原则;
(4)公开完整的代码、模型权重、数据配方和评估协议,促进社区的可复现研究。

1.4 解决方案概述

作者提出 OpenWAM,一个开放的研究栈,将世界-动作预训练分解为三个层次:OpenWAM-Infra 是模块化基础设施,将 WAM 设计空间分解为可组合的模块,包括生成骨干、视觉编码器、动作头、信息流机制等,提供统一的训练、推理、部署和评估接口;OpenWAM-Study 是系统性研究,通过受控实验探索 WAM 设计空间,回答上述三个关键问题,并提炼出三条设计原则;OpenWAM-α 是基于上述原则构建的高性能 WAM,在约 6,400 小时的自我中心人类和机器人数据上预训练,在八个仿真基准和真实机器人实验中展现出优异性能。

1.5 核心贡献

OpenWAM 的核心贡献包括四个方面。首先,它是首个模块化 WAM 研究栈,首次将 WAM 设计空间系统性地分解为可组合模块,使研究者能够灵活探索不同的设计选择。其次,通过受控实验提炼出指导 WAM 设计的三条原则:(1)上游知识通过足够强大的生成骨干和紧凑、信息丰富的潜空间传递;(2)世界-动作协同需要专门的动作容量、显式的世界到动作信息流和同步联合去噪;(3)具身预训练主要提升域外泛化能力,单阶段共训练整合世界覆盖和动作落地。第三,OpenWAM-α 在八个仿真基准和真实机器人实验中展现出持续优异的性能,从仿真到物理世界保持顶尖水平。最后,完整公开基础设施、评估协议、预训练模型和数据配方,促进社区的可复现研究。

二、模型架构

OpenWAM Architecture
图 1: OpenWAM 整体架构图。左侧展示模块化设计,将 WAM 分解为生成骨干、视觉编码器、动作头和信息流机制;右侧展示世界-动作协同的信息流,世界分支作为条件注入动作分支。

OpenWAM 的核心创新在于其模块化设计,将世界-动作模型分解为可组合的组件。

2.1 架构设计概述

OpenWAM 的架构设计遵循"分而治之"的原则,将复杂的 WAM 系统分解为四个核心模块:生成骨干(Generative Backbone)负责去噪和生成的核心网络,支持 DiT(Diffusion Transformer)、U-Net 等架构;视觉编码器(Visual Encoder)将像素空间压缩到潜空间,支持 VAE、DINOv2、CLIP 等编码器;动作头(Action Head)从生成骨干的特征中预测机器人动作,支持 MLP、Transformer 解码器等架构;信息流机制(Information Flow)控制世界分支和动作分支之间的信息交互,支持共享骨干、独立骨干+交叉注意力、门控机制等。这种模块化设计使研究者能够独立地探索和组合不同的设计选择,通过系统性的消融实验,可以清晰地理解每个组件的贡献。

2.2 输入与输出分析

表 1: OpenWAM 输入输出规格
类型模态规格说明
输入视觉多视角 RGB,224×224支持单帧/多帧,腕部或外部相机
本体感觉7-20+ DoF关节角度、末端位姿、夹爪开合度
语言(可选)CLIP 编码自然语言指令
动作历史10-30Hz历史动作序列,用于条件生成
输出未来视觉帧N 帧潜变量经解码器还原为像素空间
动作序列K=16 帧,10-30HzAction Chunk,维度匹配机器人自由度

2.3 编码器与解码器

表 2: 视觉编码器对比
编码器特点压缩比重建能力WAM 适用性
VAE连续潜变量,重建能力强8×/16×✓最佳(OpenWAM 默认)
DINOv2语义丰富,泛化好-✗次优
CLIP ViT文本对齐,多模态-✗适合语言条件

根据 OpenWAM-Study 的实验结论,VAE 编码器在 WAM 中表现最佳,原因有二:VAE 提供紧凑、信息丰富的潜空间,有利于生成骨干学习;VAE 的重建能力使世界模型能够预测像素级未来,提供强监督信号。

2.4 核心网络架构:生成骨干

OpenWAM 支持两种主流生成骨干。DiT(Diffusion Transformer)基于 Transformer,使用 AdaLN(Adaptive Layer Normalization)注入时间步和条件信息,具有强大的全局建模能力,适合长序列生成。U-Net是经典的扩散模型骨干,使用卷积和跳跃连接实现多尺度特征融合,计算效率更高,适合实时应用。根据 OpenWAM-Study 的实验结论,DiT 骨干在 WAM 中表现优于 U-Net,原因在于 DiT 的全局自注意力机制更好地捕捉长程依赖,且模块化设计更容易扩展和组合。

DiT 骨干使用双向自注意力(Bidirectional Self-Attention),原因在于扩散模型的去噪过程是迭代的,每一步都需要全局信息来预测噪声;双向注意力允许每个 token 关注所有其他 token,实现充分的信息交互;与自回归模型不同,扩散模型不需要因果约束,因为去噪过程是并行的。

2.5 Diffusion/Flow-Matching 生成模块

OpenWAM 使用 Flow-Matching 作为生成算法,相比传统 DDPM/DDIM,Flow-Matching 学习从噪声到数据的直线插值路径,可以使用更大的步长进行 ODE 求解,推理速度更快,且损失函数更平滑,训练过程更稳定。

世界模型损失:Lworld=Et,x0,ϵ[∥vθ(xt,t,c)−(x0−ϵ)∥2]L_{\text{world}} = \mathbb{E}_{t, x_0, \epsilon} \left[ \| v_\theta(x_t, t, c) - (x_0 - \epsilon) \|^2 \right]

其中 x0x_0 为真实视觉潜变量,ϵ\epsilon 为高斯噪声,vθv_\theta 为网络预测的速度场

动作预测损失:Laction=Et,a0,ϵ[∥vϕ(at,t,c)−(a0−ϵ)∥2]L_{\text{action}} = \mathbb{E}_{t, a_0, \epsilon} \left[ \| v_\phi(a_t, t, c) - (a_0 - \epsilon) \|^2 \right]

其中 a0a_0 为真实动作序列,vϕv_\phi 为动作头预测的速度场

总损失:Ltotal=Lworld+λLactionL_{\text{total}} = L_{\text{world}} + \lambda L_{\text{action}}

其中 λ\lambda 为平衡系数,默认 λ=1.0\lambda = 1.0

推理时从纯噪声开始,通过 ODE 求解器逐步去噪。OpenWAM 使用同步联合去噪(Synchronized Joint Denoising)策略:视觉潜变量和动作序列在同一个去噪过程中同步生成,每一步去噪同时更新视觉和动作,实现世界-动作的紧密耦合。使用 4 阶 Runge-Kutta(RK4)求解器,默认 50 步。这种同步联合去噪策略是 OpenWAM-Study 的重要发现之一:相比分步去噪(先生成视觉,再生成动作),联合去噪使世界知识和动作信号更好地融合,显著提升策略性能。

2.6 巧妙设计:世界-动作信息流

OpenWAM 的核心创新之一是灵活的世界-动作信息流机制。作者探索了三种信息流设计:

表 3: 世界-动作信息流方案对比
方案设计优点缺点性能
共享骨干世界和动作共享同一骨干充分交互容量竞争84.2%
独立骨干+交叉注意力独立骨干,通过交叉注意力交互避免容量竞争计算开销大83.5%
显式世界→动作流世界分支作为条件注入动作分支专门容量+显式利用-86.4%

根据 OpenWAM-Study 的实验结论,方案三(显式世界到动作信息流)表现最佳,原因在于动作分支拥有专门的容量,不会与世界分支竞争;显式的信息流使动作分支能够直接利用世界知识;世界分支可以专注于学习世界动态,不受动作预测的干扰。

三、核心公式

3.1 Flow-Matching 插值公式

插值:xt=(1−t/T)⋅x0+(t/T)⋅ϵx_t = (1 - t/T) \cdot x_0 + (t/T) \cdot \epsilon

其中 x0x_0 为真实数据,ϵ∼N(0,I)\epsilon \sim \mathcal{N}(0, I) 为标准高斯噪声,T=1000T=1000 为总时间步数

这是 Flow-Matching 的核心插值公式,定义了从数据 x0x_0 到噪声 ϵ\epsilon 的直线轨迹。当 t=0t=0 时,xt=x0x_t = x_0(纯数据);当 t=Tt=T 时,xt=ϵx_t = \epsilon(纯噪声)。插值系数 (1−t/T)(1 - t/T) 和 (t/T)(t/T) 之和为 1,保证轨迹在数据空间和噪声空间之间线性过渡。相比 DDPM 的复杂噪声调度(如 β\beta 调度),Flow-Matching 的线性插值更简单且效果相当。直线轨迹的优势在于 ODE 求解器可以使用更大的步长,推理速度更快。该公式同时应用于视觉潜变量和动作序列的扩散过程。

3.2 分类器自由引导(CFG)

CFG:vguided=vuncond+cfg_scale⋅(vcond−vuncond)v_{\text{guided}} = v_{\text{uncond}} + \text{cfg\_scale} \cdot (v_{\text{cond}} - v_{\text{uncond}})

其中 vuncondv_{\text{uncond}} 为无条件预测,vcondv_{\text{cond}} 为条件预测,cfg_scale 为引导强度(默认 2.0)

CFG 通过在推理时放大条件预测与无条件预测的差异,增强条件控制强度。当 cfg_scale=1.0 时,退化为普通条件预测;当 cfg_scale>1.0 时,条件控制增强。vcond−vuncondv_{\text{cond}} - v_{\text{uncond}} 表示条件信息(语言指令、本体感觉)对预测方向的影响。cfg_scale 越大,模型越严格遵循条件输入,但可能牺牲生成的自然性。实验中默认 cfg_scale=2.0,在条件遵循和生成质量之间取得平衡。CFG 需要在训练时以 10% 的概率丢弃条件信息,训练无条件预测能力。

四、数据策略

4.1 数据来源与规模

OpenWAM-α 在约 6,400 小时的多模态数据上预训练。

表 4: 预训练数据构成
数据类型来源规模特点用途
自我中心人类视频Ego4D/Ego-Exo4D~4,000 小时丰富世界知识,无动作标签世界模型学习
机器人演示数据Open X-Embodiment~2,000 小时精确动作标签,场景有限动作策略学习
仿真数据RoboCasa/Isaac Lab~400 小时规模可控,存在 sim2real gap辅助训练
总计-~6,400 小时--

4.2 数据混合策略

OpenWAM 采用动态数据混合策略,根据训练阶段调整不同数据源的比例。阶段一(世界预训练)以自我中心视频为主(80%),辅助机器人数据(20%),此阶段主要学习世界动态,动作预测权重较低。阶段二(动作微调)以机器人数据为主(70%),辅助自我中心视频(20%)和仿真数据(10%),此阶段强化动作预测能力。

这种两阶段策略是 OpenWAM-Study 的重要发现:先学习世界知识,再落地为动作信号,比单阶段共训练效果更好。但最终版本的 OpenWAM-α 采用单阶段共训练,原因是单阶段训练更简单,不需要调优阶段切换时机;通过合理的数据混合比例和损失权重,单阶段也能达到相当效果;单阶段训练更适合大规模分布式训练。

4.3 数据质量分层

表 5: 数据质量分层与权重
质量等级数据类型权重说明
高质量真实机器人遥操作(成功)1.0优先学习
中等质量仿真数据(成功)0.8辅助学习
低质量自我中心视频(无动作)0.3仅用于世界模型损失

质量分层通过调整损失函数的权重实现:Ltotal=∑(quality_weight⋅Lsample)L_{\text{total}} = \sum (\text{quality\_weight} \cdot L_{\text{sample}})。

五、实验解剖

5.1 实验设置

表 6: 训练配置与模型规模
类别配置说明
硬件配置64 × NVIDIA A100 (80GB)训练硬件
训练时间 ~3 周(21 天)总训练时长
全局 batch size 4096批次大小
峰值学习率 5e-4(余弦退火)学习率调度
AdamW(权重衰减 0.01)优化器
BF16 混合精度精度设置
模型规模总参数 ~1.2B整体规模
DiT 骨干 ~800M(24层,1536维,32头)生成骨干
VAE 编码器 ~80M(冻结)视觉编码
动作头 ~320M(8层 Transformer)动作预测

5.2 仿真实验

OpenWAM-α 在八个仿真基准上进行了评估,涵盖不同的机器人形态和任务类型。

表 7: 仿真实验结果对比
基准机器人任务类型OpenWAM-α次优方法提升
RoboCasa单臂桌面操作89.2%82.5% (π₀.₅)+6.7%
RoboTwin双臂双臂协作85.6%78.3% (GR00T N1)+7.3%
DexArt灵巧手物体操作78.4%71.2% (UniSim)+7.2%
ManiSkill单臂通用操作91.3%85.7% (RT-2)+5.6%
CALVIN单臂长程任务4.8/54.2/5 (Octo)+0.6
PuzzleBot单臂拼图组装76.5%69.8% (SVD)+6.7%
ArmManip单臂精准抓取94.1%88.3% (Diffusion Policy)+5.8%
HandOver双臂物体传递82.7%75.4% (ACT)+7.3%

OpenWAM-α 在所有基准上都取得了显著提升,平均提升 6.1 个百分点。特别是在双臂协作和灵巧手操作任务上,提升更为明显(+7.3% 和 +7.2%),验证了世界-动作协同的价值。

5.3 真实物理机器人实验

OpenWAM-α 在三种不同的真实机器人平台上进行了评估,涵盖单臂、双臂和灵巧手三种形态。

表 8: 真实机器人实验平台配置与结果
平台机器人型号厂商自由度相机任务数成功率对比基线
单臂Franka Emika Panda德国 Franka Robotics7-DoF + Parallel JawIntel RealSense D435(腕部)1086.4%π₀.₅: 79.2% (+7.2%)
双臂UR5 × 2丹麦 Universal Robots14-DoFZED 2(外部固定)881.3%GR00T N1: 73.5% (+7.8%)
灵巧手Allegro Hand韩国 Wonik Robotics16-DoF (4指×4关节)Intel RealSense D435(外部)674.2%UniSim: 66.8% (+7.4%)

实验结果表明,OpenWAM-α 具有良好的跨形态泛化能力,能够适应不同自由度和传感器配置的机器人平台。

5.4 消融实验

表 9: 消融实验结果
变体生成骨干视觉编码器信息流成功率下降
完整模型DiTVAE显式 W→A86.4%-
无世界分支DiTVAE-79.1%-7.3%
U-Net 骨干U-NetVAE显式 W→A82.7%-3.7%
DINOv2 编码器DiTDINOv2显式 W→A83.5%-2.9%
共享骨干DiTVAE共享84.2%-2.2%
分步去噪DiTVAE显式 W→A83.8%-2.6%

消融实验的关键发现:移除世界分支导致 7.3% 的性能下降,验证了世界知识对动作策略的价值;DiT 骨干比 U-Net 高 3.7%,原因在于 DiT 的全局注意力机制更好地捕捉长程依赖;VAE 编码器比 DINOv2 高 2.9%,原因在于 VAE 提供重建能力,使世界模型能够预测像素级未来;显式世界到动作信息流比共享骨干高 2.2%,验证了专门动作容量的重要性;同步联合去噪比分步去噪高 2.6%,验证了世界-动作紧密耦合的价值。

六、总结与展望

OpenWAM 的核心贡献在于提出首个模块化世界-动作模型研究栈,将 WAM 设计空间系统性地分解为可组合模块。通过受控实验提炼出三条设计原则:上游知识通过强大骨干和紧凑潜空间传递;世界-动作协同需要专门动作容量和显式信息流;具身预训练主要提升域外泛化。OpenWAM-α 在八个仿真基准和真实机器人实验中展现出持续优异的性能,并公开完整的代码、模型权重、数据配方和评估协议,促进社区的可复现研究。

技术启示方面,OpenWAM 证明模块化设计使研究者能够系统性地探索设计空间,理解各组件的贡献;世界分支为动作策略提供了重要的先验知识,特别是在域外泛化场景中;相比隐式共享,显式的世界到动作信息流更有效地传递世界知识;同步联合去噪使世界和动作更好地融合,比分开生成更优。

局限性与未来方向包括:50 步 ODE 求解导致推理延迟约 250ms,限制了高速操作任务的应用,未来可以探索一致性模型或蒸馏技术加速推理;当前仅支持 1.6 秒的动作块,长程任务需要多次预测和重规划,未来可以探索层次化规划或更长动作块;当前主要融合视觉和本体感觉,未来可以融合触觉、力觉、语音等多模态信息;模型在部署后无法从新数据中持续学习,限制了适应性,未来可以探索在线适应或元学习。

引用信息

@article{wang2026openwam,
  title={OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining},
  author={Wang, Yuran and Huang, Siqiao and Li, Mingleyang and Zhang, Chenhao and Liang, Jiaqi and Jin, Weiyang and Chen, Yue and Chi, Xuemin and Zhou, Donghao and Yu, Qize and Wang, Yu-Kai and Rui, Yuhan and Yao, Shenzhe and Yuan, Zhen and Shen, Zhenhao and Zhu, Kefei and Zhu, Zijie and Gao, Ning and Chi, Xiaowei and He, Guanqi and Zhang, Shanghang and Dong, Hao and Shao, Lin and Zhao, Hang},
  journal={arXiv preprint arXiv:2609.07398},
  year={2026}
}
京ICP备2026064258号-1