智能AI
morning
2026年最被低估的具身赛道:让机器人先到得了现场
摘要
编辑|Panda 前几天,我在自家小区的业主群里刷到一条招聘广告:居家靠谱副业,AI 数据采集兼职。 这类广告已经不算新鲜了。今年 5 月,第一财经报道过一批「居家数据采集员」:他们戴着采集手套或者头戴相机,在自己家里择菜、叠衣服、开抽屉,把这些动作录成视频,卖给需要训练机器人的公司。据一家数据服务商透露,其百人左右的采集员队伍里,宝妈占比接近六成,居家岗位月薪在 3000 到 4000 元之间,...
末端执行器
亿美元
数据集
GrandTour
Panda
前几天
我在自家小区的业主群里刷到一条招聘广告
居家靠谱副业
数据采集兼职
这类广告已经不算新鲜了
2026-08-28
1 阅读
约10分钟阅读
机器之心
字号:
编辑|Panda 前几天,我在自家小区的业主群里刷到一条招聘广告:居家靠谱副业,AI 数据采集兼职。 这类广告已经不算新鲜了。今年 5 月,第一财经报道过一批「居家数据采集员」:他们戴着采集手套或者头戴相机,在自己家里择菜、叠衣服、开抽屉,把这些动作录成视频,卖给需要训练机器人的公司。据一家数据服务商透露,其百人左右的采集员队伍里,宝妈占比接近六成,居家岗位月薪在 3000 到 4000 元之间,社交平台上流传的日薪多在百元上下、时薪 25 元左右。 具身智能行业对数据的渴求,可见一斑。 但我盯着那条广告看了很久,想到的是另一件事: 这些兼 职能采到 的,全都是手(末端执行器)的数据,忽视了「机器人本体与环境交互的运动数据」 。 所有人都在采数据 采的却是同一种数据 数据缺口有多大,行业已有计算。截至 2026 年初,全球高质量真实物理交互数据的总量大约只有 50 万小时 ,不足大语言模型训练语料的两万分之一。而按照产业界较为一致的口径,训练出一个真正可用的通用具身模型,至少需要 千万小时量级 。 于是资本和巨头一起涌了进来。光轮智能在今年 3 月完成合计 10 亿元融资,估值突破 10 亿美元,成为全球第一个具身数据独角兽,如今估值已超过 20 亿美元;无问智科建起了国内规模最大的实体数据采集训练场,日产数据上千小时;智元把数据业务拆分成觅蜂科技,成立十天就拿到数亿元种子轮与天使轮;京东则宣布要发动数十万人,两年内积累千万小时的真实场景数据…… 「机器人本体还没赚到钱,卖铲子的先成了独角兽。」这句话可作为今年上半年具身赛道的总结。 铲子的形状也基本定型了。今年 WAIC 和 WRC 的相关展区里,很多公司都摆出了自己的数据生产工具,路线大致分四类: 真机遥操作 ,人握着主臂、远端从臂实时复刻,力反馈毫秒级回传,数据质量最高但成本也最高; 动捕穿戴 ,把传感器穿在人身上,成本降下来了,代价是人机构型不同需要重定向; 人类行为视频 ,规模最大成本最低,但缺乏位姿、力矩、触觉的精确标注; 仿真合成 ,速度快、成本低到真实数据的百分之一,代价是域差异。 这四条路线的采集对象高度一致: 末端执行器 (也就是 手 )。 这不难理解。抓取、装配、分拣、开门是最容易被拆解成任务、最容易被标注、也容易被商业化验证的动作。数据工厂里搭出来的仓储、家庭、酒店、零售场景,本质上都是给手准备的舞台。 但这一切还有一个前提: 机器人要完成任何一项真实工作,得先走到工作现场去。 全球最大的腿式机器人公开数据集:只有五个小时 如果只看国内,很容易把这理解成一个阶段性的资源分配问题:钱先流向了最容易变现的方向,早晚会补上。但把视线拉到海外,会发现这里还有一道结构性鸿沟。 2023 年,谷歌 DeepMind 联合 21 家机构发布 Open X-Embodiment 数据集,把 60 个既有数据集合并成统一格式,包含超过 100 万条真实机器人轨迹、22 种本体、527 项技能。 这是过去三年具身领域被引用最多的基础设施之一 ,几乎所有主流 VLA 模型(从 RT-2 到 π0 再到 GR00T)都在它或它的衍生集上做过预训练。然而,这项工作仅聚焦于机器人操作(robotic manipulation)。22 种本体里虽然包含四足平台,但技能清单还是抓取、推、开、关、擦拭、装配等动作。 与之对照的是今年 2 月苏黎世联邦理工学院机器人系统实验室(ETH Zurich RSL)联合牛津大学发布的 GrandTour 数据集。他们用一台 ANYbotics 的 ANYmal-D 四足机器人,背着 7.1 公斤重、功耗 120 瓦的多模态传感器套件,跑遍了阿尔卑斯山地、森林、拆迁建筑和城市街区,采集了十台相机、三台激光雷达、多个不同等级的 IMU 以及 12 个关节编码器的同步数据,还配上了 RTK-GNSS 与徕卡全站仪提供的毫米级真值轨迹。 论文称它是 迄今为止规模最大的公开腿式机器人数据集 ,而其规模是:49 段任务,每段 3 到 7 分钟, 总时长略超过 5 小时 ,累计行走距离超过 10 公里。 GrandTour 论文中如是写道: 适用于腿式机器人的公开数据集依然稀少 ,研究者往往只能自行采集小规模、不具代表性的实验数据,或者退回到仿真里去开发状态估计、建图与感知-动作方法,而这些方法未必能泛化到真实场景的复杂度。 机器人本体与环境交互的运动数据很少,但也很重要、有价值 那么,这些机器人自己跑出来的数据为什么很重要? 正如前文暗示的那样,具身数据有两重维度: 感知与操作 :相机、激光雷达、触觉传感器记录下环境长什么样、手对物体做了什么。这一重已经被数据工厂、遥操作系统和居家采集员的手套密集覆盖。 本体与环境的交互 :机器人在什么地面上以什么姿态移动,关节输出了多大力矩,机身承受了多大冲击和振动,轮子在什么坡度上开始打滑,越障时重心如何转移。具体我们可以看 GrandTour 的传感器清单:关节位置、速度、接触力,甚至运动策略的隐藏状态都被逐帧记录下来。这些量不是运动控制的中间产物,它们本身就编码了大量信息,可作为训练素材。一个模型如果没见过这些,它或许可以知道怎么拿起杯子,但不会知道踩上一块松动的钢板时该怎么办。 于是下一个问题来了:该怎么获取机器人本体与环境交互的运动数据呢? 一个重要判断是:机器人只能自己去跑。举个例子,居家采集员可以戴上手套演示如何拧开瓶盖,但却没办法演示一台 30 公斤的机器人以 2 米每秒的速度冲上一段磨损严重的金属坡道时,各个关节各自的受力情况。人类的腿和机器人的腿在构型、质量分布、驱动方式上差异很大,动捕重定向在操作数据上还算勉强可用,到了整机动力学层面基本失效。 本末科技 D1 机器人正在现场作业 这类数据也不能靠标注补齐。标注的前提是原始记录已经存在,而力矩曲线和接触事件只在机器真的踩上去的那一刻才产生。 基于此,行业当前遇到的困难就呈现出完全不同的性质: 不是人力不够,是载体不够 。 三重结构性约束 无法靠增加人力解决 既然这些数据很重要、有价值,为什么迟迟补不上?答案,正如本末科技总结的那样,是三重叠加的结构性约束。 第一重是 仿真固有限制 。 仿真可以近乎完美地复刻几何外观,也能把渲染做得足够真实,但物理属性的复现始终是一道坎。机器人学界把它称为 Reality Gap,2017 年 OpenAI 提出的域随机化、后续 ETH 团队发展出的执行器网络辨识、以及去年开始流行的关节空间动力学拟合,都是为了绕开这道坎而生的方法。 机器人的 Reality Gap,来自 arXiv:2510.20808 方法之多本身就说明了问题的顽固程度。地面摩擦系数、材料形变、接触冲击、轮胎打滑,这些量在仿真里通常以参数形式给定,而在真实世界里它们会随温度、湿度、磨损与污染持续变化。 今年 5 月一篇针对四足轮腿机器人的研究干脆把复杂地形高程与物理摩擦当作「无法观测的外部状态(unobserved hidden states)」来处理,靠历史本体感受信号隐式估计。而 GrandTour 发布后被最快用上的方向之一,正是改进 sim-to-real 迁移与真实环境的 real-to-sim 重建。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱