首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

突破遥操瓶颈!全新无本体数据世界动作模型Noe-0发布

摘要

编辑|冷猫 我们理想中的具身智能模型,是什么样的? 或许可以归结为几个关键词:足够通用,理解真实世界,具备自主决策与行动能力,同时还能自然、高效地与人和环境持续交互。 这些关键词共同指向了一类模型:世界动作模型(WAM)。视频生成模型正在变成机器人世界模型底座,而想要真正让具身智能模型 Scaling 起来,对真实物理世界的理解深度就格外重要。 而这,是具身世界动作模型的新进展,机械手能够稳健地完...

Noe World Action Model 真实操作 RoboPocket 我们理想中的具身智能模型 是什么样的 或许可以归结为几个关键词 足够通用
2026-08-27 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|冷猫 我们理想中的具身智能模型,是什么样的? 或许可以归结为几个关键词:足够通用,理解真实世界,具备自主决策与行动能力,同时还能自然、高效地与人和环境持续交互。 这些关键词共同指向了一类模型:世界动作模型(WAM)。视频生成模型正在变成机器人世界模型底座,而想要真正让具身智能模型 Scaling 起来,对真实物理世界的理解深度就格外重要。 而这,是具身世界动作模型的新进展,机械手能够稳健地完成相对复杂、精细的现实任务: 刚刚,穹彻智能发布具身智能预训练模型 Noe-0 ,一个训练全链路采用无本体采集数据的世界动作模型。 技术博客链接: https://lab.noematrix.ai/blog/1-noe-0-research-preview/ 所有自采训练数据都来自人在真实环境中直接完成操作的记录。超 50 个城市、数十万小时、数十万种任务类型。 这是一个相当激进的策略。Noe-0 证明了完全不依靠传统的遥操数据,也可以完成具身世界模型的预训练、后训练,并在真实机器人上形成执行真实任务的能力。 Noe-0:全链路「真实操作」训练的具身模型 什么是真正的「真实操作」 传统的遥操数据,往往是在一个集中场地内搭建大量标准化工位:相似的桌面、有限的物体,以及提前设计好的任务流程。这样的环境虽然也可以被称为「真实场景」,但本质上仍是为了数据采集而人为构造出来的。 换句话说, 数据工厂可以复制工位,却很难复制真实世界本身。 因此,要想让机器人学习真实世界的知识,就必须摆脱机器人本体和固定工位。数据采集真正进入家庭、门店等日常环境,采集员直接面对真实空间中的物体和任务,数据才能自然包含不同的视角、光照、摆放方式、操作习惯以及大量难以预先设计的长尾情况。相比标准化工位,这类数据更接近机器人未来实际面对的世界,也更能体现真实世界的复杂性和多样性。 此外,研究团队观察到,同一任务通过遥操作完成通常需要直接操作的 3 至 5 倍时间,不仅增加采集成本,也容易产生缓慢、机械的动作数据。所以,在摆脱标准化工位的数采势在必行。 为了实现在真实世界里的数据采集,穹彻智能打造了高效,自然,设计优化的数据采集设备 RoboPocket(RP) 。 团队发现,如果直接沿用面向机器人执行设计的夹爪形态,会限制采集员在真实环境中的操作范围。为此,RP 将夹爪、末端形态、传感器和采集方式放在一起设计, 强调「同构设计」 :采集端与机器人末端尽可能保持一致,同时兼顾人的操作舒适度和采集效率。 RoboPocket(RP)示意图 全链路无本体数据 对 Noe-0 而言,无本体数据,「真实操作」的数据,是同时支撑预训练和后训练的数据基础。 众所周知,大模型的训练链路较长,预训练和后训练都对模型的最终能力有巨大的影响。值得注意的是, Noe-0 在预训练和后训练阶段都使用无本体数据。 预训练阶段,Noe-0 使用大规模分布式无本体数据,让模型尽可能见到更多场景、物体和任务,从中学习跨任务的视觉变化、状态转移与动作规律,建立面向真实世界的基础能力。进入后训练阶段后,团队再围绕具体任务采集更聚焦的无本体数据,用于任务适配和能力强化。 更重要的是,这种数据范式贯穿了整个训练链路。 如果预训练使用无本体数据,后训练却重新切回遥操作数据,两个阶段之间就会出现数据分布和动作模式的断层:模型在预训练中学到的自然操作规律,还需要在后训练中重新适配一套不匹配的动作表达。 Noe-0 从预训练到后训练始终沿用同一种无本体数据路线,让基础能力学习和具体任务适配保持连续,也避免后训练重新成为整条链路的能力瓶颈。 World Action Model:真实世界经验的转化 当数据真正走出标准化工位、进入真实世界后,数据的丰富性也随之带来了新的挑战,传统的 VLA 技术路线因其泛化能力受限早已不再能够满足需求。不同环境、物体、光照、视角,以及更加复杂、连续的交互过程,都要求模型具备更强的多样视频理解与世界建模能力。 这也是为什么,真实世界数据越丰富,对新一代的 World Action Model 的需求反而越迫切。 在最近的 Robotics' End Game 中,英伟达 Jim Fan 就说道:「VLAs are dead, long live World Action Models.」 World Action Model 将策略模型的骨干从语言模型替换为视频世界模型,能够回答世界的下一步状态是什么,以及机器人该如何行动来实现它。 因此, Noe-0 采用 World Action Model 架构 ,以视频预测作为核心的高层学习目标。模型接收连续历史帧与相关状态信息,预测未来的视觉状态。既要学习真实世界在交互过程中如何变化,也要把这种对状态变化的理解转化为机器人可以执行的动作。 Noe-0 的 World Action Model 架构也为后续本体升级留出了空间。 视频预测部分可以尽量复用对环境变化的理解,动作预测部分则针对不同末端执行器进行适配。由于动作侧模型规模相对较小,更换末端构型时无需重新训练整套模型,也不需要投入特别大的新增数据量。 此外,穹彻团队在实践中发现了一个关键结论, 一个此前鲜为人知的结论:即使采集数据和最终推理部署之间存在本体差异,Pixel Prediction 依然能显著提升跨本体迁移的效果。 原因在于 Pixel Prediction 为模型提供了一种隐式的反事实推理能力。当模型被要求预测未来视觉帧时,它必须从纷繁的像素信息中区分出哪些视觉变化与任务完成相关、哪些只是本体外观或背景的差异。这种训练压力迫使模型学会过滤掉与本体绑定的表面信息,抓取真正驱动任务进展的物理本质。 这一发现具有战略价值:它意味着无本体数据不仅是一种低成本,高质量的采集方案,更说明无本体数据与 World Action Model 能够实现完美的匹配,更好地帮助我们从无本体数据迁移到机器人智能。 对 Noe-0 而言,World Action Model 与全链路无本体数据是相互支撑的两个核心 :模型架构决定了如何从视觉经验中学习物理规律并转化为动作能力,数据路线决定了模型能够看到多广、多真实的世界。两者共同构成了 Noe-0 的技术基座。 AI-Native 的数据基础设施 具身智能模型需要大规模数据,这一点已经是行业共识。但「大规模」这个词经常被用来指代两种完全不同的东西。 第一种是数据量的规模化:同一类任务被重复采集更多次。第二种是经验分布的规模化:模型见过更多种类的任务、更多种物体、更多种空间、更多种现实世界中的变化。 真正能够进行 Scaling 的大规模数据是什么样的?穹彻的研究团队认为,第二种规模化更加重要: Distributional Scaling = More Data × More Tasks × More Objects × More Spaces × More Real-world Variation 为了真正实现数据的分布规模化,实现 Noe-0 的全链路无本体数据训练,穹彻的团队决定打造一系列 AI-Native 的数据方案,打造了一个 全新的「真实世界」数据基础设施 : 让采集完全脱离机器人本体,进入真实世界。 R
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱