首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

当数采设备不再稀缺,具身数据下一步拼什么?

摘要

最近一年,具身智能行业里的数据采集设备明显多了起来。入局者众多,很容易让人产生一种印象,数采硬件已经没有多少技术含量,做出一套设备似乎并不难。 但过去一年,我们采访了不少具身智能数据公司。一个越来越明显的感受是,行业已经不太缺“快速、大量采数据”的方案,真正稀缺的是能够稳定进入模型训练,并最终带来模型能力提升的数据。 数采设备越来越多,并不意味着高质量的第一视角数据已经变得容易获得。事实上,我们听...

HOMIE Gen2 Ropedia Xperience 10M Gen1 360 关键点 最近一年 具身智能行业里的数据采集设备明显多了起来
2026-08-31 1 阅读 约10分钟阅读 陈姚戈
分享:
字号:
最近一年,具身智能行业里的数据采集设备明显多了起来。入局者众多,很容易让人产生一种印象,数采硬件已经没有多少技术含量,做出一套设备似乎并不难。 但过去一年,我们采访了不少具身智能数据公司。一个越来越明显的感受是,行业已经不太缺“快速、大量采数据”的方案,真正稀缺的是能够稳定进入模型训练,并最终带来模型能力提升的数据。 数采设备越来越多,并不意味着高质量的第一视角数据已经变得容易获得。事实上,我们听到过不少因为数据质量问题拖慢甚至影响模型训练的案例。 最近,开源数据集 Xperience-10M 背后的 Physical AI 数据基础设施公司 Ropedia,发布了新一代第一视角多模态采集设备 HOMIE Gen2。 在 HOMIE Gen2 发布之前,Ropedia 的上一代设备已经被用于生产 Xperience-10M。这套数据集开源后,又陆续进入 Qwen、Ai2 等团队的模型训练。 据 AI 前线了解,从第一台原型机到今天的 HOMIE Gen2,Ropedia 的采集设备在约十二个月里迭代了四代。2025 年 6 月,团队用 3D 打印结构件搭出第一台第一视角采集原型机“竹蜻蜓”;同年 10 月,第二代 R-Ego 改进了相机布局与头戴结构,并完成第一笔硬件销售;2026 年 1 月,HOMIE Gen1 走向产品化,支撑了 Xperience-10M 的生产;到了 HOMIE Gen2,团队开始进一步解决规模化部署的问题。 一家已经把数据送进模型训练的公司,会怎么重新设计一台数采设备? 这和 Ropedia 创始团队过去的经历有关。首席科学家刘子纬是南洋理工大学副教授,长期从事计算机视觉研究,研究方向从大规模视觉数据、长尾学习逐渐延伸到 3D 视觉和空间智能;CEO 陈昭熹和 CTO 洪方舟均为清华本科、南洋理工大学博士,之后进入 Meta,前者参与过光学动作捕捉数据体系建设,后者从事第一人称多模态智能研究。 这些经历让 Ropedia 很早就确定了一种思路:从模型训练需要什么数据,反过来决定设备应该采什么、采到什么精度,以及采集之后如何处理。设备能采多少数据只是其中一环,数据最终能不能被模型有效利用,同样会影响前端的硬件设计。 HOMIE Gen1 已经证明第一视角数据可以规模化采集,HOMIE Gen2 又往前走了一步。Ropedia 希望把真实世界中的人类活动更完整、更准确地记录下来,同时降低大规模生产这类数据的成本。 HOMIE Gen2,解决四个数采问题 1. 采集视野扩大到 360° 空间 传统第一视角采集主要记录佩戴者前方发生的事情,但真实的物理任务并不只发生在正前方。人的侧面和背后,周围的物体和其他人,都可能影响一个动作的发生。 HOMIE Gen2 使用 4 目全景相机实现 360° 视野覆盖,同时加入 4 路空间音频。这样记录下来的信息可以覆盖佩戴者周围的环境,以及人与物体、环境之间的交互过程。 对于具身模型来说,这些上下文很重要。模型需要学习一个动作,也需要理解动作发生时周围有什么、人在和什么交互,以及环境随后发生了什么变化。扩大采集范围,本质上是在尽量减少真实世界信息在采集环节的损失。 2. 对齐多种传感器 现在的数采设备普遍会使用多种传感器,真正困难的是让它们准确记录同一个物理时刻。 人在快速伸手、转头或者移动时,即便只有很小的时间偏差,也可能造成视觉画面和运动信息错位。单独看每一路数据可能都没有问题,组合起来却描述了几个不同时刻的状态。 HOMIE Gen2 将 4 路视频、4 声道空间音频和 200Hz 6DoF IMU 做了硬件级同步,多传感器之间的时间同步精度达到 50 微秒。 对模型训练来说,同步精度直接影响数据是否可靠。视觉、声音和运动信息只有在时间轴上准确对应,后续的空间理解和动作学习才有一致的数据基础。 3. 开箱即用的 Xperience 数据 硬件完成采集之后,还有大量数据处理工作。 HOMIE Gen2 采集到的原始信号经过处理,会进一步形成结构化的 Xperience 数据,包括校正后的双目视频、深度图、相机位姿、手部 21 关键点、全身 52 关键点,以及任务、子任务、当前动作三层文本标注。此外还可以输出 3D 高斯、场景网格、物体检测和 4D 物体跟踪等信息。 Ropedia 还公布了一组基于 HOMIE Gen2 金标准样本集的测试结果。空间定位平均绝对误差约为千分之二,深度范围误差低于 2.5%,手部 21 关键点动捕平均误差为 4.68 mm,动作语义标注准确率达到 96.0%。 这些能力最终指向一个很实际的问题。模型公司购买数据之后,如果还需要投入大量人力完成同步、校准、动作恢复和标注,采集环节节省下来的成本,很可能又会转移到数据处理环节。 Ropedia 因此希望把处理过程继续向前延伸,让客户拿到的数据能够更快进入模型训练。HOMIE 负责记录真实世界,后面的数据处理系统则负责把这些记录加工成模型能够使用的数据。 4. 支撑真实场景规模化部署 高质量数据还要解决规模问题。 真实世界采集往往需要设备连续工作数小时,并进入家庭、工厂、商场等不同环境。设备重量、续航、存储和部署复杂度,最终都会影响数据生产的效率和成本。 HOMIE Gen2 整机约 380g,支持约 13 小时连续采集,无需提前在环境中布置外部设备;同时支持离线采集,本地 microSD 存储最高 2TB,并配有外接供电和数据接口。 据 Ropedia 介绍,HOMIE Gen2 从 CMOS、PCB 到结构件均为自研,目前具备约万台规模的产能。相比上一代方案,部署速度提升约 10 倍,采集成本降至约 1/12.5。多台设备也可以同时作业,让不同人员在同一环境中完成采集。 规模化还有另一层要求。设备数量增加之后,团队需要统一管理设备状态、采集任务和数据质量。HOMIE Gen2 因此加入了设备管理和数据采集系统,可以进行设备状态管理、远程升级和采集任务分发。 如果这些能力能够在实际交付中稳定兑现,HOMIE Gen2 就有机会把第一视角数据采集从少量设备完成的项目,变成可以批量部署的数据生产方式。 数据的竞争,正在换赛道 具身智能行业已经积累了越来越多数据,但模型真正缺的,仍然是来自真实世界、上下文完整、质量稳定,并且能够直接用于训练的人类经验数据。 这也让数据竞争的标准发生了变化。采集多少小时当然重要,但模型最终能不能用这些数据,正在成为更关键的指标。前面提到的多传感器同步、数据结构化和规模化部署,最终都要回到模型训练的效果上。 Ropedia 联合创始人兼首席科学家、南洋理工大学副教授刘子纬曾说:“如果经验是稀缺资源,那么就必须有人把它工业化。” Ropedia 想做的,就是把人类经验变成一种可以持续生产的数据资源。 今年 3 月发布的 Xperience-10M 已经验证了这条路径。它包含约 1000 万个真实世界交互片段、1 万小时带音频的第一视角视频、28.8 亿个 RGB 帧和 5.76 亿个动作捕捉帧,总规模接近 1PB。此后,这套数据进入了 Ai2、Qwen 等团队的模型训练。 对一家数据公司来说,这可能比单纯的硬件参数更有说服力。数据
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱