智能AI
morning
Facet-0:NTU王子为团队让机器人在精密装配中「看得懂、插得准、出错能恢复」
2026-09-03
1 阅读
约10分钟阅读
机器之心
字号:
机器人正在变得越来越「通用」。 从抓取日常物品,到根据语言指令完成多步骤操作,视觉 — 语言 — 动作(VLA)模型正在让机器人摆脱过去「一项任务、一套程序」的开发方式。但当机器人真正走向制造现场,问题也随之发生了变化: 会不会做,已经不是唯一标准;能不能在毫米甚至亚毫米级接触中稳定完成,并在出错后自己恢复,才决定它能否真正进入生产环节 。 精密装配恰恰是这道门槛最集中的地方。零件可能已经「看起来对齐」,却在最后几毫米发生偏斜、卡滞;一次没有恢复的异常,就可能让整条任务链中断。 项目地址: https://pine-lab-ntu.github.io/facet-0/ 论文链接: https://arxiv.org/abs/2609.01596 针对这一问题, 新加坡南洋理工大学(NTU)PINE Lab 团队 研发了面向接触丰富型精密操作的机器人基础模型 Facet-0 ,试图让机器人不仅理解「要做什么」,还能够在真实接触中判断「做得对不对」,并根据失败经验持续改进。 Facet-0 完成 RAM、CPU、Disk、GPU 等装配任务 在五项真实机器人计算机装配任务中,Facet-0 取得 82% 的平均任务成功率 ;作为对比,π0.5 为 10% ,GR00T N1.7 为 4% 。模型的放置精度达到 0.5 mm ,指令延迟约 50 ms 。 这不是自由空间抓取的演示,而是一套包含 23 个子目标 、多个对齐、插入、压合和锁定步骤的精密装配评测,其中大量关键步骤发生在 0.10–0.30 mm 的装配间隙中。 更重要的是,82% 并不是单纯依靠扩大预训练得到的。Facet-0 的完整训练流程 将成功率从预训练阶段的 16% 提升到 RL 后训练阶段的 38% ,再通过 轻量化适配达到 82% 。在部署后训练对比中, 人工干预率由 47% 降至 24% , 失败恢复率由 44% 提升至 81% 。 发生卡滞后回撤、重新对齐并完成插入 对于从未见过的内存模块,Facet-0 只使用 10 条示范、约 3 小时训练,并更新 6.6% 的参数,即 达到 45% 成功率 ; 最强基线为 5% 。 为什么精密制造需要新的机器人模型? 通用 VLA 模型已经能够理解指令、识别物体,并完成许多日常操作。但制造现场真正困难的部分,往往发生在视觉「已经完成任务」之后。 当零件进入最后几毫米,机器人面对的不再只是「零件在哪里」,而是:是否真正对准了插槽?接触力是在正常增长,还是已经发生偏斜?继续向下压,究竟会完成装配,还是把一次小误差变成卡死? 视觉擅长提供语义和几何信息,却可能看不见被夹具、机械臂遮挡的微小偏差;力 / 力矩传感器则能够直接反映接触状态。 一个零件位置几乎没有变化,但力持续增大,本身就是视觉难以提供的失败信号 。 因此,精密装配需要解决的不只是「让机器人感知到力」,而是让视觉、语言、本体状态和力觉真正参与同一条决策链:看懂任务、判断接触、及时修正,并在失败后继续完成任务。 ManuFacet-1K: 面向高精度接触操作的数据基础 要让模型学会这种能力,首先需要让数据本身包含「接触是如何发生的」。 ManuFacet-1K 包含约 1000 小时 的力同步示范与闭环运行数据,覆盖 UR7e、xArm、Franka 三种机械臂、两类服务器机箱,以及 GPU、RAM、CPU、Disk 四类安装任务。 数据集的特色不在于重新宣称一种通用采集基础设施,而在于围绕精密操作进行统一设计:每一帧同步记录多视角图像、语言指令、末端位姿、夹爪状态和六维力 / 力矩,并按照接近、对齐、插入、压合、就位、紧固、撤离等技能阶段进行标注。 更关键的是,数据并没有只保留「正确答案」。真实部署中的失败、人工接管以及随后发生的恢复过程也被留下来。 这意味着,模型学习的不再只是「成功轨迹长什么样」,还能够看到: 一个动作如何产生接触,一次正常接触和一次卡滞有什么区别,以及错误发生以后,怎样重新回到可完成任务的状态 。 Facet-0:把 VLA 的语义动作与力觉控制对齐 有了力觉数据,下一个问题随之出现: 机器人「感觉到了力」,就一定知道该怎么做吗? 答案并不必然如此。如果力觉只是作为一个额外输入进入 VLA,而训练目标仍然只要求模型模仿位置动作,那么在海量视觉特征面前,这几个力觉维度依然可能被忽略;即使模型知道发生了碰撞,原有的位置控制接口也未必允许它及时停止、回撤和重新对齐。 Facet-0 因此建立了一条从 VLA 语义决策到接触控制的对齐通路: 1. 模型同时接收多视角图像、语言指令、机器人本体状态和六维力 / 力矩历史;力觉作为独立信号进入模型,让接触状态在模型内部能够被明确表示。 2. 动作专家先生成任务相关的粗粒度动作 — 力觉片段;进入接触阶段后,精化专家结合实时力觉,把它进一步转化为更细粒度的动作,使「要完成什么」和「接触时应该怎样调整」连接起来。 3. 高频合规控制器执行最终指令,并施加工作空间、单步运动等安全约束,让模型的判断真正落实到物理交互中。 因此,Facet-0 想解决的并不是「机器人有没有力传感器」,而是更深一层的问题: 机器人能否把接触变成一种真正可理解、可评价、也可行动的信息 。 面向接触质量与自主恢复的强化学习后训练 但即使机器人已经能够感知和控制接触,还有一个更难的问题: 一次装配最终成功了,是否意味着中间所有动作都值得学习? 答案同样是否定的。两个策略都可能最终把 RAM 插进去,一个轻微调整后完成就位,另一个则持续硬顶、产生远高于正常水平的接触力。如果强化学习只在任务结束时看到一个「成功」,这两条轨迹获得的评价几乎没有区别。 Facet-0 的 RL 后训练,正是从这里开始。 第一步,是把「最终 有没有成功」拆成「 每一步到底做得怎么样」。 系统按照对齐、插入、压合、就位等子任务进行信用分配。一次轨迹即使中间发生失败,只要机器人随后成功回撤、重新对齐并完成当前阶段,这段恢复行为仍然可以得到正向评价,而不会因为整条轨迹曾经出错就被一起丢弃。 但只看阶段是否完成仍然不够,于是第二步开始判断「是怎样完成的」。 Facet-0 的价值模型同时结合动作和力 / 力矩变化评估接触质量。过大的接触力会降低信用,因此即使两个动作都完成了插入,温和对齐也会获得比强行顶撞更高的价值。机器人学习的由此不再只是「成功动作」,而是「更值得重复的成功动作」。 接下来还要解决一个容易被忽略的问题:真正决定装配成败的接触片段,在整条轨迹里往往只占很小一部分。 如果把所有时刻放在一起排序,大量自由空间运动会淹没那些短暂但关键的接触动作。Facet-0 因此分别在接触阶段和自由空间阶段进行信用筛选,把学习重点重新拉回对齐、插入、卡滞和恢复这些真正决定结果的瞬间。 最后,这些价值判断必须重新影响策略本身。 经过筛选的高价值接触经验被用于强化动作专家,使模型不仅知道哪些轨迹成功,还逐渐形成对「接下来应该产生怎样的动作和接触状态」的判断。与此同时,真实部署中的成功、失败、人工接管和恢复轨迹持续回流到训练环节,形成从 运行 → 发 现异常 → 人工纠正 / 自主恢复 → 价值评估 → 策略更新 的闭环。 这也是 Face
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱