首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

北大等联合发布Data Pyramid:用五层数据金字塔系统回答「机器人应该从什么数据中学习?」

摘要

多模态基础模型可以通过互联网规模的图像与语言学习「看」和「说」,但具身智能没有同样的捷径。机器人必须进一步理解物理状态与动力学,判断动作如何改变环境,并在真实世界中执行连续行为;这要求训练数据同时连接观察、状态、动作与物理后果。 围绕「什么数据能够支撑具身基础模型」这一核心问题,北大联合多家机构提出了具身操作数据金字塔的具体定义,将现有数据生态组织为 5 个互补层级:真机数据、UMI 式数据、自我...

UMI 机器人对齐程度 https 真机数据 式数据 自我中心与外部视角数据 可规模化程度 多样性 github embodied
2026-08-05 1 阅读 约10分钟阅读 机器之心
分享:
字号:
多模态基础模型可以通过互联网规模的图像与语言学习「看」和「说」,但具身智能没有同样的捷径。机器人必须进一步理解物理状态与动力学,判断动作如何改变环境,并在真实世界中执行连续行为;这要求训练数据同时连接观察、状态、动作与物理后果。 围绕「什么数据能够支撑具身基础模型」这一核心问题,北大联合多家机构提出了具身操作数据金字塔的具体定义,将现有数据生态组织为 5 个互补层级:真机数据、UMI 式数据、自我中心与外部视角数据、仿真数据,以及通用视觉语言数据。 该框架以「可规模化程度」和「机器人对齐程度」之间的张力为主线,并从质量、多样性、可复用性和物理保真度 4 个补充维度分析每一层数据的价值与边界。在此基础上,研究者进一步从数据配方与动作表征出发,系统梳理具身大脑模型、视觉语言动作模型和世界动作模型如何选择、对齐与混合异构数据,并总结触觉、失败恢复、规模化采集、跨本体动作对齐、自我中心数据迁移和数据配方设计等开放问题。 论文题目:Data Pyramid for Embodied Manipulation 合作机构:北京大学、南洋理工大学、香港科技大学、新加坡国立大学、香港中文大学、香港大学等 论文链接:https://arxiv.org/abs/2607.24744v1 项目主页:https://jasper-aaa.github.io/embodied-data-pyramid/ 开源仓库:https://github.com/worldbench/awesome-embodied-data-pyramid 1. 研究背景与挑战: 具身智能无法直接复制「互联网预训练」 近年来,多模态基础模型依靠海量图像、视频与语言数据,获得了广泛的感知、语义和推理能力。将这一范式扩展到具身智能时,问题发生了根本变化:机器人不仅需要识别场景和理解指令,还必须理解物体状态、接触关系和环境动力学,并将高层意图转化为可执行的控制序列。由此,具身预训练的关键不再只是「数据是否足够大」,而是数据是否包含与物理交互相关的监督。 据此,论文提出了两个贯穿全文的问题:第一,如何在可规模化程度、机器人对齐程度、物理保真度和可迁移性差异显著的前提下,收集、组织、比较并整合异构具身数据;第二,如何针对具身大脑、VLA 与世界动作模型的不同能力目标,选择并组合这些数据。 ▲ 图 1|论文整体框架。工作首先构建五层具身数据金字塔,随后分析异构数据在具身大脑、VLA 与世界动作模型中的使用方式,最后总结数据采集、对齐与配方设计的未来方向。 2. 数据金字塔: 以规模与机器人对齐组织五类数据 数据金字塔由两个核心轴组织。「可规模化程度」衡量一种数据在硬件依赖、人力投入、环境复位、安全监督和边际生成成本等方面的扩展效率;「机器人对齐程度」衡量其观察、表征和监督信号能够多直接地支持物理机器人的学习与执行。 二者通常存在张力:真机轨迹与目标平台最一致,却需要真实硬件、操作人员和反复复位;通用网络数据最容易扩展,却无法直接提供动作与接触监督。 除上述两条主轴外,本文进一步以质量、多样性、可复用性和物理保真度刻画数据的实际效用。质量关注轨迹、标注和同步是否可靠且具有信息量;多样性关注任务、物体、场景、视角、本体、传感器、行为和结果的覆盖;可复用性关注数据能否跨任务、环境、本体和模型迁移;物理保真度则关注接触、摩擦、顺应性、传感噪声、控制延迟和物体运动是否被真实记录。 从金字塔顶端到底部,5 类数据依次为真机数据、UMI 式数据、自我中心与外部视角数据、仿真数据和通用数据。这个顺序体现了数据从更强的物理落地能力与可执行监督,逐步过渡到更高的可访问性与规模。需要强调的是,该排序是 6 个维度的综合结果,并不意味着所有单项属性都严格单调变化。 ▲ 图 2|五类数据的规模演化。不同数据来源均在快速扩展,但其「规模」具有不同含义:机器人、UMI 和仿真数据通常以轨迹计,自我中心数据常以小时计,通用数据则可由问答对、图像或标注规模描述。 金字塔的核心逻辑 向下移动并非简单地「降低数据质量」,而是在放松某种机器人耦合的同时,换取更大的覆盖范围。UMI 移除了采集环节中的机器人,但保留了末端执行器监督;人类视频移除了夹爪,却保留了真实物理与开放世界交互;仿真恢复了可执行动作和特权标签,但对真实物理进行了近似;通用数据进一步放弃机器人动作,换取网络规模的语义、感知与推理覆盖。 3. 五类数据的关键洞见 3.1 真机数据:最直接的可执行监督,代价是硬件与采集闭环 真机数据位于金字塔顶端。它在同一物理闭环中记录视觉或多模态观察、机器人状态、控制动作与执行结果,因此能够直接反映真实传感噪声、控制延迟、接触动力学和硬件约束。对学习可部署的操作策略而言,没有其他数据来源能够提供同等程度的目标平台对齐。 其核心瓶颈是采集成本。每一段轨迹都依赖真实硬件、操作者或自动化策略、场景复位、维护与安全监督,难以像网络数据或仿真数据一样低成本并行扩展。不同机器人在形态、传感器、坐标系和动作空间上的差异,也使跨数据集整合远比统一文件格式更困难。 本文进一步强调,数据多样性往往比轨迹数量本身更关键。即使同一任务拥有大量示范,如果初始状态、路径、接触序列和执行速度高度重复,模型覆盖的状态—动作分布仍然有限。因此,真机数据的发展应同时关注任务、场景、本体与模态的扩展,以及任务内部的轨迹级多样性。 面向未来,真机采集需要沿 3 条路径推进:更直观、平滑且保留细粒度反馈的遥操作接口;覆盖开放环境、对象和条件变化的在野采集;以及从纯人类示范转向策略自主滚动与人在环干预,使策略自身遇到的失败状态能够转化为纠错和恢复监督。 ▲ 图 3|代表性数据集的轨迹多样性可视化。关键动作帧的空间分布揭示,即使数据量很大,不同数据集在工作空间覆盖、轨迹聚类和任务内变化上仍可能存在明显差异。 3.2 UMI 式数据:在机器人之外采集「接近机器人动作」的真实世界演示 UMI 式数据使用便携式、机器人无关的操作接口采集真实世界演示。典型系统将腕部相机、位姿追踪、夹爪状态,以及可选的力觉或触觉传感集成到手持工具中,使人类可以在日常环境中自然操作,同时记录与末端执行器近似一致的视觉和动作结构。 但 UMI 并未消除本体差距。相机视角、末端几何、运动学约束、动力学和接触条件,仍需通过标定、逆运动学和重定向解决;视觉追踪在遮挡、快速运动或低纹理环境中可能失效;数据中通常也缺少目标机器人特有的本体状态和执行器动态。因而,UMI 更适合作为真机数据的规模化补充,而不是完全替代真机数据。 3.3 Ego-centric 视角数据:以人类为智能体,获得开放世界与灵巧手先验 Ego-centric 数据来自人类在真实世界中的长期活动。这一层的关键价值不仅是「视频更多」,而是人类作为成熟智能体所产生的交互先验。手部关键点、腕部轨迹、接触序列、抓取选择、工具使用策略和任务分解,均具有跨机器人复用潜力。例如,人类五指轨迹可以为两指夹爪提供抓取与接近方向,也可以为灵巧手学习提供更高维的动作与接触结构。 其主要矛盾是规模与标注精度之间的权衡。仅依赖 RGB 的视频易于扩展,但存在遮挡、运动模糊、视角漂移,以及缺少精确手势或接触标签等问题;可穿戴追踪、IM
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱