智能AI
evening
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
2026-09-04
1 阅读
约9分钟阅读
量子位的朋友们
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理 量子位的朋友们 2026-09-04 17:19:29 来源: 量子位 星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL 真实机器人没有“暂停键”。 现在的 VLA、World-Action Model 往往一次生成未来一段时间的动作序列,也就是 action chunk。模型越来越大,推理时间也越来越长,但机器人不能每隔几百毫秒就停下来等模型推理下一段时间的动作。尤其在投掷这类高动态任务里,一次停顿就可能让已经积累起来的速度掉下去,导致整个任务失败。 所以真实部署里更常见的方式是 异步推理 :机器人继续执行手头的动作,模型同时在后台计算下一段。简单说, 手上做 A,模型已经在算 B。 但这给在线强化学习带来了一个新的问题:模型一次生成了一段动作序列(action chunk),进入物理世界的真正会用的,却往往只有其中一部分。模型“计划过”的动作,和机器人“真正做过”的动作,不再完全相同。 近日,星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL(Online Reinforcement Learning During Asynchronous Execution) 。解决的是 大模型异步推理成为真实部署常态后,与之适配的online RL 到底该从哪些动作里学。 SmoothRL 首次将这类异步 online RL 放到真实高动态投掷任务中验证,进一步证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、不能停顿的动态操作。 图注: SmoothRL 整体框架:机器人在异步执行中持续产生真实数据,基础策略提供通用能力,在线 RL 会根据真实执行结果更新动作策略。 异步执行之后,RL 为什么会“对错账”? 传统在线 RL 往往默认一种更规整的节奏:模型先算出动作,机器人执行,再根据结果更新策略。模型生成什么,机器人就执行什么。 异步执行打破了这个对应关系。等一段新的 action chunk 算出来,机器人已经沿着上一轮指令往前做了一截;而这一段新动作还没全部执行完,下一轮推理结果又可能到来,把后半段直接替换。于是,一整段 action chunk 里,有些动作已经来不及改,有些真正执行了,还有一些根本没有发生。 如果强化学习仍然把整段动作一起拿来优化,就会出现一个很直接的问题: 机器人来不及改或没做过的动作,也可能因为这次任务成功而被“记功”,或者因为失败而“背锅”。 SmoothRL 先把这笔账拆清楚。它将 action chunk 按执行状态分成三个区域: 已提交区域(committed region) :这些动作已经被上一轮推理“提交”了,不能再改变,确定会执行。 执行区域(execution region) :当前这轮新生成、机器人实际上会执行的动作。 丢弃区域(discarded region) :这些动作虽然模型生成过,但机器人根本不会执行,因为下一轮推理会把它们替换掉了。 训练的时候,不能把这三部分一视同仁。SmoothRL 的核心思想就是: 机器人真正执行了什么,就只对什么进行强化学习。 也就是说, 只让梯度穿过 execution region(执行区域)。 这样训练出来的模型,优化目标才和机器人真实运行时经历的过程一致。第二步,是让训练和部署遵守同一套时间节奏。SmoothRL 在训练 rollout 中就直接运行异步推理:模型计算和机器人执行并行发生,replay buffer 记录的也是这种真实时间关系下产生的轨迹。团队将这一原则概括为 Reinforce in Deployment(在部署强化学习) ——不是先在一个理想的同步世界里训练,再换成异步方式部署,而是从训练开始就面对机器人真正会遇到的执行动态。 在论文的具体实现中,团队采用针对各任务微调后的 π0.5 作为基础策略,并沿用 RLT 的基本骨架,用轻量 TD3-style actor-critic 在原始动作空间预测 residual correction。S1 以 30 Hz 执行动作,推理请求频率为 5 Hz,即每 200 ms 得到一个新的 action chunk。基础策略每次预测 32 帧动作;在固定延迟预算下,Committed 与 Execution 共占 12 帧,其中 6 帧属于本轮真正执行的 Execution Region,其余 20 帧在执行前会被后续 chunk 覆盖。 图注: SmoothRL 将异步 action chunk 划分为 Committed / Execution / Discarded 三个区域,并只让价值梯度通过真正执行的 Execution Region。 从高速投掷到毫米级插入,测试两类真实部署难题 团队在绳驱本体星尘智能S1上测试了三项真机任务,覆盖两类常见且互补场景:高速动态操作与 高精度双臂操作 。 特别是高动态任务 :机器人动作变化很快,如果每一步都等模型算完再执行,就会卡顿,所以必须采用异步推理。 动态投掷:39% → 94%。 机器人需要从随机位置抓取物体,再投进不同位置的目标箱。这个任务不是到达一个目标位姿就结束,而是要求手臂在摆动过程中持续积累速度,并在准确时刻释放。论文特别指出,一旦在 action chunk 边界发生停顿,手臂可能几乎降到静止,剩余摆动很难重新恢复所需释放速度。因此,它对异步执行尤其敏感。在累计 250 个 rollout episodes 的评估节点,成功率从基础策略的 39% 提升至 94%。 给笔戴帽:8% → 83%。 双臂需要把笔和笔帽精确对齐,允许的相对位姿误差约为 5 mm。基础策略通常已经能到达目标附近,但对不同笔帽位置的微小变化适应不足。最终成功率从 8% 提升至 83%。 快递开箱:30% → 90%。 机器人需要用约 1 mm 宽的刀片插入仅 2—3 mm 宽的箱盖接缝,再沿接缝切开胶带。基础策略存在稳定左偏。值得注意的是,它的学习曲线并非一路上升:150 个 rollout episodes 时成功率一度从 30% 降到 20%,随后回升至 40%,最终达到 90%。真实在线探索并不一定单调变好。 图注: 三项真机任务随累计 rollout episodes 增加的成功率变化。 比成功率更值得看的是,机器人的“错法”变了。 RL 之前,三项任务都有明显的系统性偏差:投掷时不能根据目标距离正确调节释放速度;开箱时刀片持续向左偏;给笔戴帽时,对不同笔帽位置产生过于相似的动作。在线 RL 做的,就是利用真实执行结果,一点点把这些固定偏差修回来。 到最终 checkpoint,失败已经明显向成功位置收缩。开箱任务的失败样本中,刀片相对接缝的左右偏差约为 1—2 mm ;给笔戴帽的失败样本也主要变
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱