首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

2026-09-02 1 阅读 约10分钟阅读 机器之心
分享:
字号:
视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。 这也是为什么真机强化学习如此重要:预训练和模仿学习赋予机器人一个不错的起点,而强化学习让它能够在真实环境中继续试错,适应具体物体、视角和接触动力学。但真机试错的成本远高于仿真。每一次失败都会消耗设备时间、实验人员精力,甚至破坏任务现场。 因此,真机强化学习面对的核心问题不是能否学习,而是: 如何用尽可能少的真实交互,让策略尽快学会成功? 一个自然的答案是让人类参与。模型探索错误方向时,人类可以立即接管并完成纠正。然而,对于采用流匹配(flow matching)的 VLA,新的矛盾随之出现:人类给出的是机器人动作,轻量强化学习优化的却是初始噪声。人类知道机械臂应该怎样移动,却无法直接告诉模型应该选择哪一个噪声。 人类动作与噪声空间之间,缺少一个可靠的接口。 来自 微软亚洲研究院、悉尼科技大学和清华大学的研究者提出了 UniSteer。 它通过动作到噪声的近似反演,将人类纠正转换成噪声监督,使监督学习和强化学习能够共同更新同一个轻量 noise actor,而预训练 VLA 的动作解码器始终保持冻结。 为了展示这种方法在高精度任务上的潜力,研究者让机械臂挑战了一项颇具难度的手工任务: 拼豆。 机械臂需要逐颗夹取细小的聚乙烯中空颗粒,再将其准确放到带有柱状凸起的拼豆板上。力度过大,拼豆可能弹飞;姿态稍有偏差,拼豆就无法顺利套入凸起;释放时稍有碰撞,还可能推倒已经放好的颗粒。 在 模型基础上, UniSteer 训练了额外的 noise actor,逐颗放置 16 颗拼豆,最终拼出了微软 Logo。整个任务的在线学习阶段人类数据预算仅为两条完整演示轨迹。 下面是 UniSteer 微调后的 VLA 完成拼豆任务的视频。 作者已在 arXiv 发布论文预印本,并开源训练代码。 论文标题:UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation 论文链接:https://arxiv.org/abs/2605.10821 代码链接:https://github.com/microsoft/UniSteer 噪声空间微调足够轻量,但探索仍然太昂贵 目前不少 VLA 使用流匹配来生成连续动作。给定视觉观测、机器人状态和语言指令,模型先采样一个高斯噪声,再通过多步去噪,将它逐渐变换为一段机器人动作。 如果直接对整个 VLA 做在线强化学习,不仅计算代价高,还需要让梯度穿过多步动作生成过程,训练容易变得不稳定。噪声空间强化学习提供了一条更轻量的路线:冻结预训练 VLA,只训练一个小型 noise actor,由它根据当前状态选择初始噪声,再交给冻结的 VLA 解码成动作。 其执行过程可以写成: 其中, 是可训练的 noise actor, 是冻结的 VLA 动作解码器。强化学习的 critic 也直接评估状态与噪声的组合 。 这种设计有两个直接优势。其一,只更新小型 actor,训练成本显著降低;其二,所有动作仍由预训练 VLA 解码,因此不会轻易偏离模型原有的动作先验。 但轻量并不等于高效。 当初始策略成功率很低、奖励又只在任务完成时出现,noise actor 仍需要依靠自主试错寻找少量成功轨迹。如果机械臂始终以错误姿态接近物体,它就很难获得任何正奖励,更谈不上从奖励中学习。 人类纠正本应解决这一问题:看到机械臂从错误方向靠近勺子,人类可以接管并把夹爪移动到更低、更容易抓取的位置。然而,这条纠正轨迹记录的是动作 ,noise actor 需要学习的却是噪声 。 这就把问题收敛为一个关键技术问题: 能否找到一个噪声,使冻结的 VLA 恰好生成接近人类纠正的动作? 动作无法直接监督 noise actor,UniSteer 选择反演整个生成过程 UniSteer 的核心思路并不复杂:既然冻结的 VLA 定义了从噪声到动作的映射,就沿着这条路径反向寻找产生人类动作的初始噪声。 对固定状态 ,流匹配解码器从初始噪声 出发,沿速度场 演化,并在终点得到动作 : 在连续时间下,如果速度场满足论文给出的连续性与 Lipschitz 条件,这个从噪声到动作的映射是双射:每个动作都存在唯一的初始噪声与之对应。真正的困难在于,实际模型采用离散的 Euler 步完成解码,而单步逆映射仍然依赖未知的输入。 定义一次前向更新为: 要从输出 恢复输入 ,需要求解: 右侧仍然包含未知的 ,因此无法直接代入求解。但它天然构成一个不动点方程。UniSteer 从 开始反复迭代: 当速度场关于 的 Lipschitz 常数为 ,并满足 时,这个映射是压缩映射,迭代会收敛到唯一的不动点。于是,UniSteer 可以从人类动作开始,逐步逆转每一个 Euler 去噪步骤,最终恢复对应的初始噪声 。 同一个噪声接口,如何同时接住人类纠正与强化学习? 得到目标噪声之后,人类指导终于可以直接进入 noise actor 的训练。 在模型自主执行时,系统记录状态、noise actor 采样的噪声、奖励与下一状态,并将它们放入强化学习缓冲区。人类接管时,UniSteer 将纠正动作 反演为目标噪声 ;这条数据一方面进入演示缓冲区,用均方误差直接监督 actor: 另一方面也进入强化学习缓冲区,帮助 critic 学习这些更有价值的状态 — 噪声组合。随后,actor 再根据 critic 给出的价值信号继续优化: 因此,人类纠正和强化学习不再分别修改动作模型的不同部分,而是通过同一个噪声接口更新同一个 actor。监督学习先把 actor 拉向人类指出的有希望区域,强化学习再利用任务奖励,在这些区域附近继续探索和巩固。 平均 66 分钟从 20% 到 90%,提升来自更有效的探索 研究者在 AgileX Piper 机械臂上测试了拿起勺子、堆叠积木、插入方块和折叠毛巾四项真机任务,覆盖抓取放置、精密接触和可变形物体操作。 系统以 30 Hz 接收侧视与腕部两路 RGB 图像、6D 末端位姿和夹爪状态。四项正式基准实验均从预训练的 架构出发,每项任务先使用 30 条示范进行预热,再进入在线真机微调。 经过平均 66 分钟在线微调,UniSteer 将四项任务的平均成功率从 20% 提升到 90%。作为对比,只做噪声空间强化学习、不使用人类指导的 DSRL 达到 55%;在动作空间聚合人类示范的 DAgger 达到 60%。 为了检验模型是否只是在重复示范,研究者还专门设置了分布外(OOD)初始位置。初始策略在三项任务的 OOD 测试中成功率均为 0%。经过 UniSteer 微调后,三项任务的 OOD 成功率全部达到 100%。相比之下,DSRL 在三项 OOD 测试中分别达到 0%、0% 和 25%,DAgger 则分别为 75%、100% 和 25%。 相比于 DAgger 这样经典的人工
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱