首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

UniSteer用机械臂拼豆:让人类指导进入VLA噪声空间强化学习

摘要

(本文阅读时间:11 分钟) 编者按 : 随着具身智能持续发展,机器人基础模型正在从 “ 学会完成任务 ” 进一步走向 “ 适应 真实环境 ” 。 VLA 模型让机器人能够同时理解视觉、语言与动作,也让通用机器人操作有了更统一的技术底座。但真正走向现实世界后,如何用更低成本完成后训练,仍然是决定模型能否从 “ 会做 ” 走向 “ 做好 ” 的关键问题。 近日 , 微软亚洲研究院与悉尼科技大学、清华...

VLA actor UniSteer noise 颗拼豆 Logo 本文阅读时间 编者按 随着具身智能持续发展 机器人基础模型正在从
2026-09-18 1 阅读 约10分钟阅读 微软研究院AI
分享:
字号:
(本文阅读时间:11 分钟) 编者按 : 随着具身智能持续发展,机器人基础模型正在从 “ 学会完成任务 ” 进一步走向 “ 适应 真实环境 ” 。 VLA 模型让机器人能够同时理解视觉、语言与动作,也让通用机器人操作有了更统一的技术底座。但真正走向现实世界后,如何用更低成本完成后训练,仍然是决定模型能否从 “ 会做 ” 走向 “ 做好 ” 的关键问题。 近日 , 微软亚洲研究院与悉尼科技大学、清华大学联合提出的 UniSteer ,正是围绕这一问题展开探索。研究尝试将人类指导引入 VLA 的噪声空间强化学习,让有限的人类干预能够更直接地服务于真机策略优化。在四项真机任务中, UniSteer 经过平均 66 分钟 在线微调,将平均成功率从 20% 提升至 90% 。在更精细的拼豆任务中,在线学习阶段仅使用 2 条完整人工演示轨迹 作为人类数据预算,机械臂最终逐颗放置 16 颗拼豆 ,完成微软 Logo 。 本文转载自公众号 “ 机器之心 ” 。 视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。 这也是为什么真机强化学习如此重要:预训练和模仿学习赋予了机器人一个不错的起点,而强化学习则让机器人能够在真实环境中继续试错,适应具体物体、视角并接触动力学。但真机试错的成本远高于仿真,每一次失败都会消耗设备、时间、实验人员精力,甚至破坏任务现场。 因此,真机强化学习面对的核心问题不是能否学习,而是 如何用尽可能少的真实交互,让策略尽快学会成功? 一个自然的答案是让人类参与。模型探索错误方向时,人类可以立即接管并完成纠正。然而,对于采用流匹配(flow matching)的 VLA来说,新的矛盾随之出现。人类给出的是机器人动作,轻量强化学习优化的却是初始噪声,也就是说人类知道机械臂应该怎样移动,却无法直接告诉模型应该选择哪一个噪声。 人类动作与噪声空间之间,缺少一个可靠的接口。 来自 微软亚洲 研究院、悉尼科技大学和清华大学的研究员们提出了 UniSteer。 它 通过动作到噪声的近似反演,可将人类纠正转换成噪声监督,使监督学习和强化学习能够共同更新同一个轻量噪声行为体( noise actor),而预训练 VLA 的动作解码器始终保持冻结 。 为了展示这种方法在高精度任务上的潜力,研究员们让机械臂挑战了一项颇具难度的手工任务: 拼豆。 机械臂需要逐颗夹取细小的聚乙烯中空颗粒,再将其准确放到带有柱状凸起的拼豆 板上。力度过大,拼豆可能弹飞;姿态稍有偏差,拼豆就无法顺利套入凸起;释放时稍有碰撞,还可能推倒已经放好的颗粒。 在 模型基础上, UniSteer 训练了额外的 noise actor,逐颗放置 16 颗拼豆,最终拼出了微软 Logo。整个任务的在线学习阶段人类数据预算仅为两条完整演示轨迹。 演示视频:UniSteer 微调后的 VLA 完成拼豆任务 相关论文及训练代码的开源信息已整理至文末,欢迎点击了解更多技术详情。 噪声空间微调足够轻量,但探索仍然太昂贵 目前不少 VLA 使用流匹配来生成连续动作。给定视觉观测、机器人状态和语言指令,模型先采样一个高斯噪声,再通过多步去噪,将它逐渐变换为一段机器人动作。 如果直接对整个 VLA 做在线强化学习,不仅计算代价高,还需要让梯度穿过多步动作生成过程,训练容易变得不稳定。噪声空间强化学习提供了一条更轻量的路线:冻结预训练 VLA,只训练一个小型 noise actor,由它根据当前状态选择初始噪声,再交给冻结的 VLA 解码成动作。 其执行过程可以写成: 其中, 是可训练的 noise actor, 是冻结的 VLA 动作解码器。强化学习的评价器(critic)直接评估状态与噪声的组合 。这种设计有两个直接优势。其一,只更新小型的行动体(actor)训练成本显著降低;其二,所有动作仍由预训练 VLA 解码,因此不会轻易偏离模型原有的动作先验。 但轻量并不等于高效。 若初始策略成功率很低、奖励又只在任务完成时出现,noise actor 仍需要依靠自主试错寻找少量成功轨迹。如果机械臂始终以错误姿态接近物体,它就很难获得任何正奖励,更谈不上从奖励中学习。 人类纠正本应解决这一问题:看到机械臂从错误方向靠近勺子,人类可以接管并把夹爪移动到更低、更容易抓取的位置。然而,这条纠正轨迹记录的是动作 ,noise actor 需要学习的却是噪声 。这就把问题收敛为一个关键技术问题, 能否找到一个噪声,使冻结的 VLA 恰好生成接近人类纠正的动作? 图1: UniSteer 原理图及性能概要 动作无法直接监督 noise actor,UniSteer 选择反演整个生成过程 UniSteer 的核心思路并不复杂,既然冻结的 VLA 定义了从噪声到动作的映射,那就沿着这条路径反向寻找产生人类动作的初始噪声。 对固定状态 ,流匹配解码器从初始噪声 出发,沿速度场 演化,并在终点得到动作 : 在连续时间下,如果速度场满足论文给出的连续性与 Lipschitz 条件,这个从噪声到动作的映射是双射,每个动作都存在唯一的初始噪声与之对应。真正的困难在于,实际模型采用离散的 Euler 步完成解码,而单步逆映射仍然依赖未知的输入。 定义一次前向更新为: 要从输出 恢复输入 ,需要求解: 右侧仍然包含未知的 ,因此无法直接代入求解。但它天然构成一个不动点方程。UniSteer 从 开始反复迭代: 当速度场关于 的 Lipschitz 常数为 ,并满足 时,这个映射是压缩映射,迭代会收敛到唯一的不动点。于是,UniSteer 可以从人类动作开始,逐步逆转每一个 Euler 去噪步骤,最终恢复对应的初始噪声 。 同一个噪声接口,如何同时接住人类纠正与强化学习? 得到目标噪声之后,人类指导终于可以直接进入 noise actor 的训练。 在模型自主执行时,系统记录状态、noise actor 采样的噪声、奖励与下一状态,并将它们放入强化学习缓冲区。人类接管时,UniSteer 将纠正动作 反演为目标噪声 ;这条数据一方面进入演示缓冲区,用均方误差直接监督 actor: 另一方面也进入强化学习缓冲区,帮助 critic 学习这些更有价值的状态 - 噪声组合。随后,actor 再根据 critic 给出的价值信号继续优化: 因此,人类纠正和强化学习不再分别修改动作模型的不同部分,而是通过同一个噪声接口更新同一个 actor。监督学习先把 actor 拉向人类指出的有希望区域,强化学习再利用任务奖励,在这些区域附近继续探索和巩固。 图2: UniSteer 流程图 平均 66 分钟从 20% 到 90%,提升来自更有效的探索 研究员们在 AgileX Piper 机械臂上测试了拿起勺子、堆叠积木、插入方块和折叠毛巾四项真机任务,覆盖抓取放置、精密接触和可变形物体操作。 系统以 30 Hz 接收侧视与腕部两路 RGB 图像、6D 末端位姿和夹爪状态。四项正式基准实验均从预
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱