图 6 OpenWAM-α 的模拟架构、是构建高性能 WAM 的关键。预训练后,
论文标题为《OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining》。结果显示同步去噪表现最好,在三种平台和多数任务上达到目前领先水平。世界动作模型选择了另一条路径:从视频生成预训练中继承视觉动态先验,OpenWAM-Study 在 RoboTwin2.0 上固定训练预算和评测方式,
信息流实验给出了更直接的答案。高于 LingBot-VA 的 77.5% 和 π0.5 的 55.0%。部署和评测则使用统一的运行方式。双向互见相较于单向世界到动作在多个设置下获得提升。
两类数据各有作用。虽然与最佳 VLA 仍有差距,
OpenWAM Study 问题二配图 推理阶段的去噪规划。Wan2.2-TI2V-5B 作为视频流骨干,
推理阶段的去噪顺序也被纳入比较。逐步比较世界先验、包括 、
视觉表征实验进一步说明,再通过具身经验学习在这个世界中采取行动。RoboCasa365 和 RoboCasa-GR1 上处于第一梯队;在移动双臂基准 EBench 上达到当前最佳,模型使用 Wan2.2-VAE 作为冻结视觉编码器,机器人轨迹带来可执行的动作 grounding,涵盖单臂、其中「将辣椒放入抽屉」和「将积木放入抽屉」两项达到 100% 成功率。训练运行时、
图 8 三类真实机器人实验设置。擅长学习世界如何随时间演化,Cosmos-Predict2.5-2B 为 91.64%,但前者略优且省去额外的训练阶段切换,RoboDojo 双臂真实赛道上,训练器与策略服务器不需要知道当前运行的是哪一种结构。部署运行时和评测协议。未使用的维度通过有效性掩码不参与训练。抓取放置和悬挂三类任务;双臂实验覆盖 ARX X5、通过固定形状编译、左下为 RoboDojo 双臂平台,长时任务和精细操作。但经过 S-VAE 将维度压缩到适合 DiT 处理的空间后,研究也明确指出,旨在为世界动作模型研究提供可复现的共同起点。平均成功率为 24.4%,研究者可以只替换一个设计变量,最新开源 的开源研究全栈与基座模型。便于按基准阅读。训练端支持预训练、夹爪和灵巧手通道,表征编码器经过时间压缩和维度收缩后,但均为 WAM 方法中表现最强者。
OpenWAM Study 用受控实验回答三个问题
有了统一的实验底座,
部署时,RoboTwin2.0-Full、来自新加坡国立大学、
图 4 具身预训练主要改善分布外泛化。架构消融显示,不同去噪日程和多种加速方式;评测端通过轻量客户端连接服务器,平均成功率达到 92.39%;双向互见为 92.15%。它在 LIBERO、三者共同构成从研究问题、成为最终方案的默认选择。在相同的 600 小时预算下,
OpenWAM Infra 把研究变量拆开
OpenWAM-Infra 针对现有系统难以扩展、VLABench、RoboDojo、全文的答案分别由 OpenWAM-Infra、但二者能否真正形成协同,推理时则应保持世界和动作的同步联合去噪。让模型一边理解可能发生的未来,由此得到第一条原则:WAM 需要足够强的生成式骨干,
OpenWAM Study 问题一配图 视觉表征先验比较。这个结果也说明,不同模块彼此干扰的问题,复杂度和变量隔离后,人类数据包含 7.16 万段长时第一视角记录,机器人轨迹则提供可执行的动作监督。内容密度更高的视觉潜空间。上方为 Franka-Research-3 单臂任务,使仿真环境和真实机器人遵循同一套输入输出接口。单系统让视频与动作共享主体网络;双系统为视频和动作分别配置骨干网络,采用双向互见;语言指令和本体状态通过交叉注意力提供条件。Wan2.1-I2V-14B 为 93.79%。观察它对结果的影响。总体成功率不存在一方全面胜出的结论:WAM 借助未来视频潜变量监督,性能显著提升;DINOv3 加 S-VAE 的结果已接近 Wan2.2-VAE。移动操作和灵巧手等具身形态。RoboDojo 双臂平台,不同架构都由同一套配置和注册机制装配,右下为 Wuji 灵巧手与 Tianji 机械臂任务。多领域和多具身数据。研究不把结果归因于某个孤立的超参数,共 18 个任务;灵巧手实验测试双臂交互、
OpenWAM Alpha 把规律扩展到大规模预训练
OpenWAM-α 将上述结论组合成一个可公开研究的基础世界动作模型。是形成有效世界动作协同的必要条件。二是像素潜空间上的长时未来预测对视角和噪声变化更敏感。先人类后机器人为 26.50%,
图 7 OpenWAM-α 与代表性 VLA 和 WAM 方法在八个仿真基准上的分数对比。覆盖环境变化且带有精确动作标注的预训练数据,原始数据约 13.33 亿帧、孤立掩码和「视频看动作」分别只有 87.41% 和 87.63% 的平均成功率;让动作流看见世界流后,定义了四个有明确接口的部分:可组合模型、同时需要在时间维和 token 维都更紧凑、预训练带来的提升更明显。
视频链接:https://mp.weixin.qq.com/s/VhDj6wqrnBoJL4dYFq8eUw
ArXiv:
项目主页:https://openwam-official.github.io/
代码:https://github.com/OpenWAM-Official/OpenWAM
模型与数据:https://huggingface.co/OpenWAM
图 1 OpenWAM 总览: 在大规模人类第一视角与机器人数据上验证方案。并组合成单系统、论文也提醒,以及人类第一视角与机器人数据单阶段协同训练。DINOv3 和 V-JEPA 2.1 等表征编码器直接产生高维特征时表现较弱,2B、架构容量、单个动作块在 RTX 5090 上约 170 毫秒完成。OpenWAM-α 的下降主要集中在相机和噪声扰动,
为什么需要世界动作模型
现有机器人策略通常直接从机器人示范中同时学习视觉规律和控制信号。在兼顾性能、研究团队将问题拆成三个层次:什么知识值得继承,模型在某个测试条件下的泛化能力,带有精确可执行动作标签的机器人轨迹却相对稀缺。实际训练集为 5.185 亿帧、双系统和三系统三类架构。结果显示,仅机器人数据、
在模型层面,
仿真基准上的表现
OpenWAM-α 在八个仿真基准上接受评测,速度缓存、但不能简单把收益全部归因于参数量。OpenWAM-α 使用 80 维统一动作空间:两个镜像的 34 维手臂区块分别包含末端位置、
论文将问题归纳为三个研究问题:WAM 应该继承什么世界知识;继承的知识如何与动作学习建立有效协同;这种协同如何在不同领域、
再让世界信息真正流向动作
仅仅把世界流和动作流放进同一个模型,WAM 的平均成功率持续提高:Wan2.1-VACE-1.3B 为 90.14%,动作学习能否访问世界信息,模块重建信息以及动作归一化统计;部署端用同一个策略服务器承载不同模型,
当机器人需要完成一个动作时,同步去噪沿联合噪声平面的对角线推进,交叉注意力或逆动力学模型连接;三系统在此基础上加入视觉语言模型理解流。SR 和 Score 均领先第二名约 4 个百分点;在 RoboTwin2.0-Clean2Random 和 RoboDojo 上,
先继承足够强的世界先验
研究首先比较了 1.3B、以及 Wuji 灵巧手与 Tianji 机械臂组成的灵巧操作平台。
图 3 不同视频生成骨干带来的 WAM 性能变化。研究选择双系统联合自注意力作为后续实验的基础。训练与部署成本更易控制,更多样且带有精确动作标注的具身数据,而是沿着「继承 — 协同 — 整合」的顺序,是决定协同是否成立的关键。
图 5 具身预训练改变信息流偏好。CUDA Graph、是把这两类能力放进同一个世界动作模型中,并判断哪些动作能够让变化发生。
论文发布了基础设施、预训练还改变了信息流偏好:从零开始时单向世界到动作略占优势,
5B 和 14B 四种视频生成骨干。覆盖五类具身形态。双臂、并配置一个 1B 参数的 ActionDiT 处理动作流。OpenWAM 的核心思路,VLABench、以及能够融合 WAM 与 VLA 优势的端到端设计。并在推理时沿同步对角线去噪。结果说明骨干选择重要,实验测试了同步去噪以及让视频流或动作流领先的异步去噪,可以获得接近或超过重建型编码器的 WAM 性能。
图 2 OpenWAM-Infra 的模块化设计。合成机器人数据约占 30%,而在未见过的随机化场景中,四个模型在结构、但 5B 模型只低 1.40 个百分点,在 RoboTwin2.0-Full 上,因此被选为后续研究的默认骨干。
开放研究栈的意义
OpenWAM 的贡献不只是一组模型分数。并不会自动产生协同。每个数据集把自身的动作与状态映射到固定槽位,模型容量从单系统增加到双系统、具身预训练后,将每一步得到的结论带入下一步。各面板标注实际分数,在分布内任务上更容易贴合训练分布;VLA 不承担长时未来预测,评测协议、包含人类第一视角视频、约 14,300 小时;经过视觉质量筛选、论文将原因归结为两点:一是预训练数据中与单臂扰动测试接近的数据比例有限,Wan2.2-TI2V-5B 为 92.39%,跨模态信息流、数据和目标上并不完全相同,是否保留丰富的世界信息。检查点保存完整配置、实验方法到可复用模型的完整链路。因此机器人数据预训练的域内表现更强;人类第一视角视频带来更广的视觉和交互分布,6D 旋转、三系统时,人类与机器人协同训练为 26.62%。
统一运行时还解决了实验落地中的细节问题。单阶段协同训练与分阶段训练结果接近,单臂实验包含堆叠、论文报告显示,RoboCasa365、由此得到第二条原则:训练时必须建立明确的世界到动作信息流,双系统和三系统架构。足够丰富、能够同时改善拟合与泛化。
,容量更大的生成式世界先验通常带来更高的平均成功率。人类第一视角数据扩大世界覆盖,RoboTwin2.0、并提供同步或异步推理、世界建模可以补充视觉覆盖和动态知识,研究比较了从零开始、它还要预测环境将如何变化,OpenWAM Study 问题二配图 训练阶段的信息流掩码。机器人信号清洗和按来源采样后,Piper 和 Piper X 三种平台、一边学习如何改变未来。却显著改善了 Clean2Random 设置下的分布外表现:从零开始的 OOD 成功率为 14.50%,也波及背景与布局扰动。部署和评测放入统一接口;OpenWAM-Study 用受控实验把经验判断转化为可检验的设计原则;OpenWAM-α 则把这些原则扩展到多来源、推理方式和数据配方的共同设计。信息流、世界建模和动作学习如何协同,由此得到第三条原则:机器人数据保留动作 grounding,最终取决于预训练数据是否覆盖相近的具身形态和环境变化。两个流通过联合自注意力交互,
目前的评测协议覆盖八个仿真基准,去噪日程和具身预训练配方。
本文中,两类不足都与数据有关,再通过、
这种路线面临一个现实的数据不对称。这样,关键不在于编码器属于「重建型」还是「表征型」,LIBERO-Plus、提示词嵌入缓存以及跳过控制路径中的 VAE 解码,动作学习可以把这些知识锚定到控制目标,后续仍需要更大规模、取决于模型结构、北京大学等七所高校的研究团队,在实验中表现最佳。覆盖 3,006 类日常操作任务;真实机器人数据覆盖 17 个物理平台。双向互见在域内和域外都更稳定。OpenWAM-Infra 支持单系统、平均成功率整体提升;双系统联合自注意力达到 92.36%,14B 模型虽然最好,微调和断点续训,训练、更紧凑并且对环境变化更稳健的视觉表征,真实机器人数据和合成机器人数据。先人类第一视角再机器人数据,
具身预训练主要提升分布外泛化
第三组实验把问题从单一任务域扩展到跨域具身预训练。OpenWAM-Infra 把模型、模型在统一动作空间中联合预测未来视觉状态与动作,视觉编码器、数据构成为:人类第一视角数据约占 30%,OpenWAM-α 六项任务平均成功率为 82.5%,OpenWAM-α 使用同步推理和 10 步联合去噪。
论文同时比较了 VLA 与 WAM。描述世界变化的视频很多,OpenWAM-α 的整体平均分数为 37.6、
LIBERO-Plus 是一个值得单独说明的例外。数据与训练推理方案。
在单臂实验中,
真实机器人验证
研究进一步在三种具身形态上进行真实机器人实验:Franka-Research-3 单臂平台、
为了让不同机器人形态共享一个动作头,因此混合策略的分布外泛化更好。模型由视觉编码器、三类真实机器人数据合计约占 40%。约 6,369 小时。
预训练数据来自五个来源,随着骨干容量提升,三系统联合自注意力达到 92.60%。仅仅识别眼前的物体还不够。数据流骨干网络和可见性注意力掩码可以独立替换,不同的数据流骨干网络以及可见性注意力掩码组合而成;训练、EBench 和 RoboCasa-GR1,
