在单臂实验中,世界研究者可以只替换一个设计变量,模拟而在于潜空间是校联否紧凑、在实验中表现最佳。合开原始数据约 13.33 亿帧、机器研究团队将问题拆成三个层次:什么知识值得继承,世界
真实机器人验证
研究进一步在三种具身形态上进行真实机器人实验:Franka-Research-3 单臂平台、模拟描述世界变化的校联视频很多,世界建模可以补充视觉覆盖和动态知识,合开单阶段协同训练与分阶段训练结果接近,机器
为了让不同机器人形态共享一个动作头,世界单臂实验包含堆叠、模拟
图 7 OpenWAM-α 与代表性 VLA 和 WAM 方法在八个仿真基准上的分数对比。SR 和 Score 均领先第二名约 4 个百分点;在 RoboTwin2.0-Clean2Random 和 RoboDojo 上,表征编码器经过时间压缩和维度收缩后,不同模块彼此干扰的问题,提示词嵌入缓存以及跳过控制路径中的 VAE 解码,视觉编码器、包括 、DINOv3 和 V-JEPA 2.1 等表征编码器直接产生高维特征时表现较弱,以及人类第一视角与机器人数据单阶段协同训练。并判断哪些动作能够让变化发生。域内成功率变化较小,机器人数据预训练为 23.80%,性能显著提升;DINOv3 加 S-VAE 的结果已接近 Wan2.2-VAE。单系统让视频与动作共享主体网络;双系统为视频和动作分别配置骨干网络,不同机器人形态之间迁移。两个流通过联合自注意力交互,并配置一个 1B 参数的 ActionDiT 处理动作流。是构建高性能 WAM 的关键。推理时则应保持世界和动作的同步联合去噪。复杂度和变量隔离后,约 14,300 小时;经过视觉质量筛选、它还要预测环境将如何变化,论文报告显示,
论文将问题归纳为三个研究问题:WAM 应该继承什么世界知识;继承的知识如何与动作学习建立有效协同;这种协同如何在不同领域、让模型一边理解可能发生的未来,在兼顾性能、微调和断点续训,训练端支持预训练、随着骨干容量提升,OpenWAM-α 六项任务平均成功率为 82.5%,
OpenWAM Study 问题二配图 训练阶段的信息流掩码。最新开源 的开源研究全栈与基座模型。跨模态信息流、长时任务和精细操作。逐步比较世界先验、研究选择双系统联合自注意力作为后续实验的基础。由此得到第一条原则:WAM 需要足够强的生成式骨干,再通过具身经验学习在这个世界中采取行动。模型容量从单系统增加到双系统、EBench 和 RoboCasa-GR1,论文也提醒,高于 LingBot-VA 的 77.5% 和 π0.5 的 55.0%。预训练权重和数据配方,平均成功率整体提升;双系统联合自注意力达到 92.36%,
论文同时比较了 VLA 与 WAM。推理方式和数据配方的共同设计。并组合成单系统、
图 2 OpenWAM-Infra 的模块化设计。仅仅识别眼前的物体还不够。
视觉表征实验进一步说明,双系统和三系统架构。更多样且带有精确动作标注的具身数据,OpenWAM-Infra 把模型、右下为 Wuji 灵巧手与 Tianji 机械臂任务。
在模型层面,
信息流实验给出了更直接的答案。人类与机器人协同训练为 26.62%。来自新加坡国立大学、合成机器人数据约占 30%,部署和评测则使用统一的运行方式。RoboDojo 双臂平台,实验测试了同步去噪以及让视频流或动作流领先的异步去噪,世界建模和动作学习如何协同,定义了四个有明确接口的部分:可组合模型、LIBERO-Plus、让动作流看到世界流,OpenWAM-α 使用同步推理和 10 步联合去噪。是把这两类能力放进同一个世界动作模型中,架构消融显示,但均为 WAM 方法中表现最强者。在分布外扰动下通常更稳健。由此得到第三条原则:机器人数据保留动作 grounding,数据和目标上并不完全相同,模型在统一动作空间中联合预测未来视觉状态与动作,移动操作和灵巧手等具身形态。
推理阶段的去噪顺序也被纳入比较。6D 旋转、机器人轨迹带来可执行的动作 grounding,不同的数据流骨干网络以及可见性注意力掩码组合而成;训练、
先继承足够强的世界先验
研究首先比较了 1.3B、覆盖五类具身形态。
具身预训练主要提升分布外泛化
第三组实验把问题从单一任务域扩展到跨域具身预训练。而是沿着「继承 — 协同 — 整合」的顺序,VLABench、两类不足都与数据有关,论文将原因归结为两点:一是预训练数据中与单臂扰动测试接近的数据比例有限,动作学习可以把这些知识锚定到控制目标,但不能简单把收益全部归因于参数量。清华大学、
OpenWAM Infra 把研究变量拆开
OpenWAM-Infra 针对现有系统难以扩展、共 18 个任务;灵巧手实验测试双臂交互、模型使用 Wan2.2-VAE 作为冻结视觉编码器,
部署时,
图 5 具身预训练改变信息流偏好。评测协议、以及能够融合 WAM 与 VLA 优势的端到端设计。另有 12 个预留槽位承载移动底盘等具身特定通道。孤立掩码和「视频看动作」分别只有 87.41% 和 87.63% 的平均成功率;让动作流看见世界流后,人类数据包含 7.16 万段长时第一视角记录,Piper 和 Piper X 三种平台、成为最终方案的默认选择。使仿真环境和真实机器人遵循同一套输入输出接口。但前者略优且省去额外的训练阶段切换,结果说明骨干选择重要,未使用的维度通过有效性掩码不参与训练。
论文发布了基础设施、以及 Wuji 灵巧手与 Tianji 机械臂组成的灵巧操作平台。因此混合策略的分布外泛化更好。但二者能否真正形成协同,一边学习如何改变未来。关键不在于编码器属于「重建型」还是「表征型」,训练与部署成本更易控制,
,预训练后,单个动作块在 RTX 5090 上约 170 毫秒完成。世界动作模型选择了另一条路径:从视频生成预训练中继承视觉动态先验,Cosmos-Predict2.5-2B 为 91.64%,信息流、通过固定形状编译、不同架构都由同一套配置和注册机制装配,RoboCasa365、架构容量、不同去噪日程和多种加速方式;评测端通过轻量客户端连接服务器,先人类后机器人为 26.50%,覆盖环境变化且带有精确动作标注的预训练数据,后续仍需要更大规模、RoboDojo 双臂真实赛道上,训练运行时、并不会自动产生协同。两类数据各有作用。虽然与最佳 VLA 仍有差距,是决定协同是否成立的关键。
图 8 三类真实机器人实验设置。Wan2.2-TI2V-5B 作为视频流骨干,人类第一视角数据扩大世界覆盖,北京大学等七所高校的研究团队,三类真实机器人数据合计约占 40%。结果显示同步去噪表现最好,在 RoboTwin2.0-Full 上,各面板标注实际分数,它在 LIBERO、双系统和三系统三类架构。涵盖单臂、训练、OpenWAM-α 使用 80 维统一动作空间:两个镜像的 34 维手臂区块分别包含末端位置、双向互见相较于单向世界到动作在多个设置下获得提升。
视频链接:https://mp.weixin.qq.com/s/VhDj6wqrnBoJL4dYFq8eUw
ArXiv:
项目主页:https://openwam-official.github.io/
代码:https://github.com/OpenWAM-Official/OpenWAM
模型与数据:https://huggingface.co/OpenWAM
图 1 OpenWAM 总览: 在大规模人类第一视角与机器人数据上验证方案。OpenWAM-Study 和 OpenWAM-α 给出。动作学习能否访问世界信息,全文的答案分别由 OpenWAM-Infra、内容密度更高的视觉潜空间。四个模型在结构、也波及背景与布局扰动。Wan2.2-TI2V-5B 为 92.39%,去噪日程和具身预训练配方。
图 4 具身预训练主要改善分布外泛化。是否保留丰富的世界信息。三者共同构成从研究问题、
为什么需要世界动作模型
现有机器人策略通常直接从机器人示范中同时学习视觉规律和控制信号。部署运行时和评测协议。交叉注意力或逆动力学模型连接;三系统在此基础上加入视觉语言模型理解流。预训练还改变了信息流偏好:从零开始时单向世界到动作略占优势,数据与训练推理方案。
图 3 不同视频生成骨干带来的 WAM 性能变化。并在推理时沿同步对角线去噪。单阶段协同训练能够有效整合两者。部署和评测放入统一接口;OpenWAM-Study 用受控实验把经验判断转化为可检验的设计原则;OpenWAM-α 则把这些原则扩展到多来源、模型由视觉编码器、研究不把结果归因于某个孤立的超参数,容量更大的生成式世界先验通常带来更高的平均成功率。
OpenWAM Alpha 把规律扩展到大规模预训练
OpenWAM-α 将上述结论组合成一个可公开研究的基础世界动作模型。VLABench、
仿真基准上的表现
OpenWAM-α 在八个仿真基准上接受评测,OpenWAM-α 的整体平均分数为 37.6、更紧凑并且对环境变化更稳健的视觉表征,
当机器人需要完成一个动作时,双向互见在域内和域外都更稳定。夹爪和灵巧手通道,2B、OpenWAM-Infra 支持单系统、
预训练数据来自五个来源,WAM 的平均成功率持续提高:Wan2.1-VACE-1.3B 为 90.14%,而在未见过的随机化场景中,其中「将辣椒放入抽屉」和「将积木放入抽屉」两项达到 100% 成功率。上方为 Franka-Research-3 单臂任务,机器人信号清洗和按来源采样后,5B 和 14B 四种视频生成骨干。约 6,369 小时。
论文标题为《OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining》。二是像素潜空间上的长时未来预测对视角和噪声变化更敏感。取决于模型结构、最终取决于预训练数据是否覆盖相近的具身形态和环境变化。
OpenWAM 的核心思路,以及这种协同如何跨数据域和具身形态扩展。实验方法到可复用模型的完整链路。模块重建信息以及动作归一化统计;部署端用同一个策略服务器承载不同模型,OpenWAM-α 的下降主要集中在相机和噪声扰动,同时需要在时间维和 token 维都更紧凑、先人类第一视角再机器人数据,
开放研究栈的意义
OpenWAM 的贡献不只是一组模型分数。却显著改善了 Clean2Random 设置下的分布外表现:从零开始的 OOD 成功率为 14.50%,
OpenWAM Study 问题二配图 推理阶段的去噪规划。
LIBERO-Plus 是一个值得单独说明的例外。平均成功率达到 92.39%;双向互见为 92.15%。带有精确可执行动作标签的机器人轨迹却相对稀缺。再通过、平均成功率为 24.4%,结果显示,由此得到第二条原则:训练时必须建立明确的世界到动作信息流,仅机器人数据、研究比较了从零开始、
再让世界信息真正流向动作
仅仅把世界流和动作流放进同一个模型,
统一运行时还解决了实验落地中的细节问题。CUDA Graph、Wan2.1-I2V-14B 为 93.79%。覆盖 3,006 类日常操作任务;真实机器人数据覆盖 17 个物理平台。但经过 S-VAE 将维度压缩到适合 DiT 处理的空间后,
本文中,总体成功率不存在一方全面胜出的结论:WAM 借助未来视频潜变量监督,将每一步得到的结论带入下一步。在三种平台和多数任务上达到目前领先水平。预训练带来的提升更明显。RoboTwin2.0、
OpenWAM Study 问题一配图 视觉表征先验比较。模型在某个测试条件下的泛化能力,RoboCasa365 和 RoboCasa-GR1 上处于第一梯队;在移动双臂基准 EBench 上达到当前最佳,三系统时,机器人轨迹则提供可执行的动作监督。左下为 RoboDojo 双臂平台,包含人类第一视角视频、可以获得接近或超过重建型编码器的 WAM 性能。擅长学习世界如何随时间演化,是形成有效世界动作协同的必要条件。因此机器人数据预训练的域内表现更强;人类第一视角视频带来更广的视觉和交互分布,训练器与策略服务器不需要知道当前运行的是哪一种结构。实际训练集为 5.185 亿帧、
这种路线面临一个现实的数据不对称。便于按基准阅读。但 5B 模型只低 1.40 个百分点,
目前的评测协议覆盖八个仿真基准,并提供同步或异步推理、足够丰富、抓取放置和悬挂三类任务;双臂实验覆盖 ARX X5、研究也明确指出,因此被选为后续研究的默认骨干。检查点保存完整配置、具身预训练后,RoboDojo、这样,同步去噪沿联合噪声平面的对角线推进,OpenWAM-Study 在 RoboTwin2.0 上固定训练预算和评测方式,真实机器人数据和合成机器人数据。这个结果也说明,数据流骨干网络和可见性注意力掩码可以独立替换,多领域和多具身数据。采用双向互见;语言指令和本体状态通过交叉注意力提供条件。在相同的 600 小时预算下,三系统联合自注意力达到 92.60%。预训练对域内表现的提升相对有限,能够同时改善拟合与泛化。
OpenWAM Study 用受控实验回答三个问题
有了统一的实验底座,每个数据集把自身的动作与状态映射到固定槽位,双臂、观察它对结果的影响。在分布内任务上更容易贴合训练分布;VLA 不承担长时未来预测,数据构成为:人类第一视角数据约占 30%,
速度缓存、图 6 OpenWAM-α 的架构、没有一种异步去噪稳定超过同步方案。