首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

无本体数据直达真机,深朴智能拔掉机器人后训练的「真机数据锚点」

摘要

编辑|Youli 当下,一个逐渐清晰的共识是,具身智能的叙事正由「会不会做一个动作」,转向「能不能在真实世界里稳定完成复杂任务」。尤其是在刚刚过去的 WAIC2026 现场,这一点尤为明显,机器人不再满足于表演式的单动作演示,而是被期待走进产线、仓储和酒店客房,真正「做事」。 不过,Demo 与落地之间,隔着一道明确的鸿沟。VLA 还是 WAM?模型够不够大?参数够不够多?等等,路线之争尚无定论。...

UMI HiFi https VLA WAM 把采集设备从机器人身上拆下来 simple world lab Youli
2026-08-04 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|Youli 当下,一个逐渐清晰的共识是,具身智能的叙事正由「会不会做一个动作」,转向「能不能在真实世界里稳定完成复杂任务」。尤其是在刚刚过去的 WAIC2026 现场,这一点尤为明显,机器人不再满足于表演式的单动作演示,而是被期待走进产线、仓储和酒店客房,真正「做事」。 不过,Demo 与落地之间,隔着一道明确的鸿沟。VLA 还是 WAM?模型够不够大?参数够不够多?等等,路线之争尚无定论。但有一个难题明确而具体: 数据,尤其是高质量操作数据。 前段时间,「AI 教母」、斯坦福大学教授李飞飞再次重申这一难题,直言, 不同于 LLM 可以从互联网上获取丰富数据资源,具身智能从训练到评估阶段,数据都十分匮乏…… 仔细来看,目前行业中的几大数据来源各有优劣。 互联网视频规模大,但缺少精确动作信息;真机遥操数据足够准确,却需要同时占用机器人、操作员和固定场地,成本高,扩展速度也慢;UMI 等无本体采集方案提供了另一条路径,把采集设备从机器人身上拆下来,解决了进入更多真实环境的问题。 可过去很长一段时间里, 这类无本体数据由于保真度缺陷,主要用于模型预训练,到了学习具体任务的后训练阶段,团队仍要补充一定比例的真机遥操作数据,作为「锚点」, 对齐机器人本体、执行时延、相机视角和真实环境差异。 行业普遍做法,是不断降低这部分真机遥操作数据的占比,缩小「锚点」,可只要「锚点」仍然存在,就意味着无本体数据始终无法独立完成从训练到部署的闭环。 有没有另一种可能: 与其继续压缩真机数据,能否提高无本体数据本身的保真度,让「锚点」失去必要性? 这就是深朴智能推出 HiFi-UMI 的出发点。 近期, 深朴智能发布高保真无本体数据生产引擎 HiFi-UMI, 将便携式采集设备、轨迹重建、数据治理、模型训练和真机部署连接起来。 实验中,后训练阶段仅使用 HiFi-UMI 示范,策略便能部署到真实机器人上。在 VLA 与 WAM 两类架构的三个代表模型中,整体成功率达到同域真机遥操作数据的相近水平。与此同时,使用同一批语料进行大规模预训练后,模型在十个未见任务上的平均动作预测误差进一步下降了 41%。 这意味着, 无本体数据开始从一种用于扩充预训练语料的数据源,继续走向任务后训练和真实机器人执行…… 论文链接:https://arxiv.org/pdf/2607.25895 项目主页:https://cloud.simpleai.tech/simple-world-lab/hifi-umi/ 开源数据集:https://huggingface.co/datasets/simple-world-lab/HiFi-UMI-2K 「无本体数据」,为什么一直停在预训练阶段? 其实,长期以来,UMI 数据被挡在后训练「门外」,不是行业偏见,而是有着真实的技术局限性。 首先要承认的是, UMI 确实解决了机器人操作数据最直观的规模问题。 真机遥操作要求机器人、操作员和任务环境同时在线,每次操作失败后,物体需要重新复位,机器人需要恢复初始状态,硬件还可能出现磨损和故障。随着采集规模扩大,设备调度、人员管理和场地维护都会成为新的成本。 而 UMI 类无本体采集将人类示范与机器人硬件解耦, 把采集设备从机器人身上拆下来,不需要操控一台真实机器人,只需携带便携设备进入家庭、酒店等场景,就能记录人类完成擦拭、整理、折叠和搬运等操作,由此摆脱机器人数量限制,可以进入更多真实环境。 但规模大,并不代表数据已经能够直接驱动机器人。因为 预训练和后训练,对数据的要求并不相同。 预训练阶段,模型可以从数据中学习手应该靠近哪个物体,一项任务通常包含哪些步骤,抓取之后大致应该朝哪个方向移动。而到了后训练阶段,要求会明显提高,机器人需要知道末端应该落在哪个具体位置,两只手应该保持怎样的距离和角度,夹爪应该在哪一帧闭合,发生接触后又该如何继续移动。 毫米级的误差不会妨碍模型理解「将遥控器放入槽位」,却足以导致「真实插入」的失败。 因此,无本体数据从预训练走向后训练,核心挑战就在于 数据够不够保真? 而传统 UMI,存在明显的四大保真度方面的局限性: 轨迹漂移: 位姿依赖腕部在线视觉 SLAM,操作过程中视角频繁被手部或物体遮挡,长时程任务中,轨迹漂移问题严重; 双手「各说各话」: 双手相对位姿通过跨相机共视重建,而非原生测量,协调任务误差大; 时间不同步: 相机、夹爪编码器和位置传感器往往来自不同设备,靠软件或无线对齐,过程中模型可能会把视觉状态与错误动作对应起来,存在毫秒级时差,而在快速移动、夹爪闭合和物体接触的瞬间,这种错位会直接影响策略学习; 视野盲区: 单只手仅一个鱼眼相机,视野盲区大、深度线索弱,模型看到了动作开始和结束,却未必看清中间发生了什么。 这些问题共同限制了传统 UMI 数据的能力边界: 它可以帮助模型形成通用操作经验,却很难独立承担对精度要求更高的任务后训练 。 破局:HiFi-UMI 软硬件协同、「四重保真」 深朴智能认为,既然保真度不够,那就想办法啃下这块「硬骨头」。为此,深朴智能没有基于旧流程进行修补,而是围绕「轨迹精度、双手位姿、时间同步、视野覆盖」四个维度,对采集硬件和数据处理进行了系统性重构。 头戴式双目惯性 SLAM,求解原生相对位姿 传统 UMI 通常把视觉定位的主要视角放在手腕上,而 HiFi-UMI 将定位基准转移到了相对稳定的头部,采用头戴式双目相机与惯性测量单元(IMU),通过离线双目惯性 SLAM 重建头部轨迹。 同时,左右手分别安装视觉标记结构,由头部双目相机在统一坐标系中同步定位,这样,两只手的相对位姿在采集过程中直接形成,不需要先分别重建两条轨迹,再进行事后拼接。 结果是,在手写轨迹实验中, HiFi-UMI 可以重建毫米级笔尖运动,工作空间内末端轨迹误差约为 3 毫米, 全程不依赖外部动捕或定位设备。 时间层面的对齐:统一 GPIO 硬件同步,消灭跨传感器偏差 传统方案的毫秒级软件同步,在这里,HiFi-UMI 使用 统一 GPIO 硬件触发器 取代,六路相机、IMU 和夹爪编码器被同一根「神经」驱动,跨传感器间时间同步误差压缩到 40 微秒 以内。 机器人策略学习的是,在某个视觉和状态输入下,应该输出什么动作。如果图像、手部位姿和夹爪状态没有严格同步,训练样本中的状态与动作就会发生错位。微秒级硬件同步让视觉、轨迹和夹爪状态尽可能对应同一个物理时刻。 6 路视觉协同:全局定位与局部感知互补 视觉覆盖方面,HiFi-UMI 在每只手上配置上下两枚超广角鱼眼相机,再加上头部双目,共形成 6 路视觉输入。 头部视角提供完整的全局观察,记录环境、目标物体和任务进度;腕部视角靠近夹爪和操作区域,负责捕捉接触、抓取和物体局部变化。 单腕水平和垂直视角均约 200° , 当目标物体在某一路视频中受到遮挡时,其他视角仍可能保留关键操作信息。系统可以据此识别操作对象、判断任务进度、确定动作边界,也能为轨迹检查、失败分析和 AI 辅助标注提供更多依据。 全掌手套,让操作更「像人」 此外,值得一提的是,HiFi-UMI 还采用 全掌手套式夹爪, 兼顾小物体精细操作和较大物体抓取。采集者能够采用更接近自然抓取和发力的方
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱