汽车
morning
零样本干活!Figure 机器人走进 30 个陌生家庭,整理客厅、折毛巾、铺床
摘要
人形 机器人 真正走向家庭,难点或许从来不是“会不会做家务”,而是换一个家庭之后,它还能不能继续做。 9月17日,美国人形机器人公司Figure发布了 Helix 2.5,将其称为Figure 构建的最先进的神经网络。 这一次,Figure把测试场景从熟悉的实验室搬到了30个此前没有见过的家庭,让机器人直接面对不同的房间布局、家具和物品,并完成整理客厅、折叠毛巾和铺床三项任务。 Figure披露,...
Helix
从零开始训练
成功率只有9
机器人
真正走向家庭
难点或许从来不是
会不会做家务
而是换一个家庭之后
它还能不能继续做
9月17日
2026-09-18
1 阅读
约10分钟阅读
AGI-Signal
字号:
人形 机器人 真正走向家庭,难点或许从来不是“会不会做家务”,而是换一个家庭之后,它还能不能继续做。 9月17日,美国人形机器人公司Figure发布了 Helix 2.5,将其称为Figure 构建的最先进的神经网络。 这一次,Figure把测试场景从熟悉的实验室搬到了30个此前没有见过的家庭,让机器人直接面对不同的房间布局、家具和物品,并完成整理客厅、折叠毛巾和铺床三项任务。 Figure披露,在这30个家庭的测试中,机器人没有提前采集环境数据,也没有针对这些家庭进行微调。最终,经过其人类行为数据集Index预训练的模型,在零样本测试中的完整任务成功率达到56%;作为对照,从零开始训练、其他条件保持一致的模型,成功率只有9%。 这组数据背后,Figure真正想展示的并不是机器人又学会了几个家务动作,而是 机器人能否把从过去数据中学到的能力,迁移到一个此前从未见过的真实环境中。 这也是Helix 2.5此次发布最值得关注的地方。 Figure把机器人带进30个陌生家庭 过去几年,人形机器人最常见的能力展示,是在一个相对可控的环境中完成一系列预先设计好的任务。机器人能够走路、抓取、搬运,也可以折衣服、整理物品甚至操作厨房设备,但这些演示背后往往有一个容易被忽略的前提, 机器人已经对所在环境进行了充分训练。 现实中的家庭显然不是这样。 同样是一张床,不同家庭的床垫高度、床架结构和房间空间都可能不同;同样是一条毛巾,大小、厚度和材质也存在差异。对于人类来说,这些变化并不会改变我们对铺床或者折毛巾这件事情的基本理解,但对机器人而言,每一种变化都可能意味着一个新的训练变量。 Figure选择的三个看起来并不复杂场景: 整理客厅、叠毛巾和铺床 。 难点在于,Figure并没有把测试条件设置得很规整。客厅里的玩具和小型物品,形状、大小、硬度和材质各不相同;毛巾有不同的尺寸、颜色、厚度和纹理;床铺则使用了不同材质、重量和颜色的床罩、被子和枕头。 不仅物体不同, 环境也不同 。每个家庭都有自己的家具、地面、灯光和操作空间,床的高度、床架结构和离地间隙也存在差异。甚至物品一开始怎么摆放,Figure也没有进行统一控制:玩具被随意扔在地板、沙发和桌子上,毛巾被随手丢在桌面,被子和枕头则被故意弄乱。 也就是说,Figure测试的并不是“机器人能不能把一条固定毛巾叠起来”,而是 换一条没见过的毛巾、换一个没见过的桌面,它还能不能完成同一个动作 。整理客厅也是如此,机器人需要先在陌生房间里找到13至15件物品,再从不同位置将它们收进篮子;铺床则要求机器人围绕床移动、放置枕头,并整理和拉紧床罩。 这些任务共同的特点是,它们并不存在一套完全固定的动作路径,同时考验视觉感知、移动、抓取、双手协同以及全身控制能力,Figure将这种能力称为 whole-body intelligence,即全身智能 。 目前大多数关于机器人泛化能力的研究都是在围绕机器构建的环境中进行的。桌面机械臂的工作空间是固定的;轮式机器人需要足够的开放空间来容纳和转弯。而家庭环境则不具备这样的条件。 人形机器人必须在家庭环境中移动,调整身体位置,才能观察、够到并操作其他外形尺寸的机器人无法进入的狭小、杂乱空间中的物体。 Figure公布的结果是,Helix 2.5在30个陌生家庭中,三个任务的 完整任务成功率达到56% 。作为对比,从零开始训练、没有经过Index预训练的模型,成功率只有9%。Figure称,使用Index进行预训练后,模型的零样本任务成功率提高了6倍以上。 据报道,Helix 2.5 是首个在家庭环境中,面对从未接触过的物体,零次尝试就实现这一目标的系统。 这组数据当然还不足以说明人形机器人已经真正实现了“开箱即用”。30个家庭、3类任务仍然是一个有限的测试范围,而且这些任务主要集中在家庭环境。但从实验设计来看,Figure这次试图回答的问题已经发生了变化, 机器人不只是要学会某项技能,还要学会把技能带到一个没见过的地方。 如果一个模型只能在训练过的房间里整理玩具,那么它更像一个经过高度优化的自动化系统;如果它进入一个从未见过的家庭,面对不同的家具和物体依然能够完成相同任务,那么机器人基础模型的价值才真正开始显现。 Helix 2.5此次发布,Figure显然更希望外界关注后一个问题。 让机器人学习“人类怎么做事” Helix 2.5之所以能够在陌生环境中表现出一定的泛化能力,背后还有一个重要变化, Figure开始把人类行为数据放到了机器人预训练的核心位置。 今年8月,Figure推出了名为 Index 的数据平台,并将其定义为全球规模的人类行为数据集。按照Figure此前公布的信息,Index已经覆盖108个国家,拥有超过4.4万名周活跃数据贡献者,累计上传超过1600万段视频,数据来源覆盖家庭、餐厅、物流、工厂和办公室等真实环境。 与传统机器人数据集不同,Index并不是单纯记录“机器人完成某个任务”的数据,而是 先大量收集人类在物理世界中的行为,再让机器人从这些“人类经验”中进行基础预训练。 这背后的逻辑并不难理解。一个人第一次走进陌生的房间,并不需要提前接受“这个房间应该怎么走”的专门训练。看到桌子、椅子、床和地面之后,人类已经拥有足够多的生活经验,可以根据具体环境决定下一步怎么行动。即使没有见过这张床,人也知道怎样铺床;即使没有见过这条毛巾,也知道怎样把它折起来。 Figure希望机器人也能够获得类似的经验。因此, Helix 2.5从随机初始化开始,完全使用Index进行预训练;之后再通过任务数据,让同一个基础模型分别适配整理客厅、折叠毛巾和铺床三个任务。 这实际上改变了过去机器人训练的一种常见思路。传统的机器人学习往往围绕具体任务展开,想让机器人学会叠毛巾,就采集大量叠毛巾的数据;想让它学会整理房间,就继续采集整理房间的数据。这样做能够快速提升特定任务的表现,但当机器人换到另一个环境,或者遇到没有见过的物体时,往往又需要补充新的数据。 Figure希望把这件事情前移。在具体学习“叠毛巾”之前,机器人先通过大量人类行为数据,学习人类如何观察环境、移动身体、操作物体以及完成连续动作。这样,当任务发生变化时,模型不需要从零开始理解整个物理世界,而只需要在已经形成的基础能力上进行适应。 Figure此次的对照实验,正是为了验证Index在其中发挥了多大作用。 Figure在 Index 数据集的嵌套子集上训练了四个模型, 预训练数据规模扩大到原来的8倍,机器人动作预测的loss随着数据增加持续下降,并且呈现出较为稳定的变化趋势。Figure据此提出了所谓的“human-to-humanoid robot transfer scaling law”,试图证明人类经验向机器人能力的迁移,也可能存在类似大模型训练中的规模效应。 这并不能说明人类数据已经解决了机器人泛化问题,但至少说明了一件事情, 对于机器人基础模型而言,大规模的人类行为数据可能不仅是训练数据的一种补充,而正在成为模型获得通用能力的重要来源。 具身智能可能进入另一场竞争 如果只看机器人完成铺床、折毛巾这些任务,Helix 2.5并没有改变行业的基本认知。真正值得关注
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱