智能AI
morning
七校联合开源OpenWAM:机器人的「世界模拟器」来了
2026-09-25
1 阅读
约10分钟阅读
机器之心
字号:
本文中,来自新加坡国立大学、清华大学、北京大学等七所高校的研究团队,最新开源 OpenWAM,面向世界动作模型的开源研究全栈与基座模型。 ArXiv:https://arxiv.org/abs/2609.07398 项目主页:https://openwam-official.github.io/ 代码:https://github.com/OpenWAM-Official/OpenWAM 模型与数据:https://huggingface.co/OpenWAM 图 1 OpenWAM 总览:OpenWAM-Infra 提供模块化基础设施,OpenWAM-Study 提炼设计规律,OpenWAM-α 在大规模人类第一视角与机器人数据上验证方案。 当机器人需要完成一个动作时,仅仅识别眼前的物体还不够。它还要预测环境将如何变化,并判断哪些动作能够让变化发生。视频生成模型擅长学习世界如何随时间演化,机器人轨迹则提供可执行的动作监督。 OpenWAM 的核心思路,是把这两类能力放进同一个世界动作模型中,让模型一边理解可能发生的未来,一边学习如何改变未来。 论文标题为《OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining》。研究团队将问题拆成三个层次:什么知识值得继承,世界建模和动作学习如何协同,以及这种协同如何跨数据域和具身形态扩展。全文的答案分别由 OpenWAM-Infra、OpenWAM-Study 和 OpenWAM-α 给出。 核心结论 :OpenWAM 通过模块化基础设施把世界动作模型从紧耦合的单一实现,转化为可控、可复现的实验体系;研究结果表明,充足的生成式世界先验、紧凑且信息丰富的视觉表征、明确的世界到动作信息流,以及跨域具身预训练,是构建高性能 WAM 的关键。 为什么需要世界动作模型 现有机器人策略通常直接从机器人示范中同时学习视觉规律和控制信号。视觉语言动作模型则更多继承图像文本预训练带来的语义和语言知识。世界动作模型选择了另一条路径:从视频生成预训练中继承视觉动态先验,再通过具身经验学习在这个世界中采取行动。 这种路线面临一个现实的数据不对称。描述世界变化的视频很多,带有精确可执行动作标签的机器人轨迹却相对稀缺。世界建模可以补充视觉覆盖和动态知识,动作学习可以把这些知识锚定到控制目标,但二者能否真正形成协同,取决于模型结构、信息流、推理方式和数据配方的共同设计。 论文将问题归纳为三个研究问题:WAM 应该继承什么世界知识;继承的知识如何与动作学习建立有效协同;这种协同如何在不同领域、不同机器人形态之间迁移。 OpenWAM Infra 把研究变量拆开 OpenWAM-Infra 针对现有系统难以扩展、不同模块彼此干扰的问题,定义了四个有明确接口的部分:可组合模型、训练运行时、部署运行时和评测协议。模型由视觉编码器、不同的数据流骨干网络以及可见性注意力掩码组合而成;训练、部署和评测则使用统一的运行方式。这样,研究者可以只替换一个设计变量,观察它对结果的影响。 图 2 OpenWAM-Infra 的模块化设计。视觉编码器、数据流骨干网络和可见性注意力掩码可以独立替换,并组合成单系统、双系统和三系统架构。 在模型层面,OpenWAM-Infra 支持单系统、双系统和三系统三类架构。单系统让视频与动作共享主体网络;双系统为视频和动作分别配置骨干网络,再通过联合自注意力、交叉注意力或逆动力学模型连接;三系统在此基础上加入视觉语言模型理解流。不同架构都由同一套配置和注册机制装配,训练器与策略服务器不需要知道当前运行的是哪一种结构。 统一运行时还解决了实验落地中的细节问题。训练端支持预训练、微调和断点续训,检查点保存完整配置、模块重建信息以及动作归一化统计;部署端用同一个策略服务器承载不同模型,并提供同步或异步推理、不同去噪日程和多种加速方式;评测端通过轻量客户端连接服务器,使仿真环境和真实机器人遵循同一套输入输出接口。 目前的评测协议覆盖八个仿真基准,包括 LIBERO、LIBERO-Plus、VLABench、RoboTwin2.0、RoboDojo、RoboCasa365、EBench 和 RoboCasa-GR1,涵盖单臂、双臂、移动操作和灵巧手等具身形态。 OpenWAM Study 用受控实验回答三个问题 有了统一的实验底座,OpenWAM-Study 在 RoboTwin2.0 上固定训练预算和评测方式,逐步比较世界先验、架构容量、跨模态信息流、去噪日程和具身预训练配方。研究不把结果归因于某个孤立的超参数,而是沿着「继承 — 协同 — 整合」的顺序,将每一步得到的结论带入下一步。 先继承足够强的世界先验 研究首先比较了 1.3B、2B、5B 和 14B 四种视频生成骨干。随着骨干容量提升,WAM 的平均成功率持续提高:Wan2.1-VACE-1.3B 为 90.14%,Cosmos-Predict2.5-2B 为 91.64%,Wan2.2-TI2V-5B 为 92.39%,Wan2.1-I2V-14B 为 93.79%。14B 模型虽然最好,但 5B 模型只低 1.40 个百分点,训练与部署成本更易控制,因此被选为后续研究的默认骨干。论文也提醒,四个模型在结构、数据和目标上并不完全相同,结果说明骨干选择重要,但不能简单把收益全部归因于参数量。 图 3 不同视频生成骨干带来的 WAM 性能变化。容量更大的生成式世界先验通常带来更高的平均成功率。 OpenWAM Study 问题一配图 视觉表征先验比较。表征编码器经过时间压缩和维度收缩后,可以获得接近或超过重建型编码器的 WAM 性能。 视觉表征实验进一步说明,关键不在于编码器属于「重建型」还是「表征型」,而在于潜空间是否紧凑、是否保留丰富的世界信息。DINOv3 和 V-JEPA 2.1 等表征编码器直接产生高维特征时表现较弱,但经过 S-VAE 将维度压缩到适合 DiT 处理的空间后,性能显著提升;DINOv3 加 S-VAE 的结果已接近 Wan2.2-VAE。由此得到第一条原则:WAM 需要足够强的生成式骨干,同时需要在时间维和 token 维都更紧凑、信息密度更高的视觉潜空间。 再让世界信息真正流向动作 仅仅把世界流和动作流放进同一个模型,并不会自动产生协同。架构消融显示,模型容量从单系统增加到双系统、三系统时,平均成功率整体提升;双系统联合自注意力达到 92.36%,三系统联合自注意力达到 92.60%。在兼顾性能、复杂度和变量隔离后,研究选择双系统联合自注意力作为后续实验的基础。 OpenWAM Study 问题二配图 训练阶段的信息流掩码。让动作流看到世界流,是形成有效世界动作协同的必要条件。 信息流实验给出了更直接的答案。在 RoboTwin2.0-Full 上,孤立掩码和「视频看动作」分别只有 87.41% 和 87.63% 的平均成功率;让动作流看见世界流后,平均成功率达到 92.39%;双向互见为 92.15%。动作学习能否访问世界信息,是决定协同是否成立的关键。 OpenWAM
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱