首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI evening

北大与微软亚研提出 BCP,让模型自己决定何时重规划

摘要

在 action chunking 已成为 VLA 标配的今天,「一次执行多少步」几乎被所有工作当作一个固定的超参数。北京大学与微软亚洲研究院的一项新工作指出:这个默认设定本身就是一个重要的失败原因 —— 它让重规划变成了与任务进度无关的周期性调度,当没有任何一次重规划恰好落在关键操作阶段之前时,机器人只能带着一个已经过时的 chunk 进入关键操作环节。 研究团队提出了 Berno u lli-...

horizon VLA chunk action Continuation BCP chunking Policy GRPO RoboTwin
2026-08-20 1 阅读 约10分钟阅读 机器之心
分享:
字号:
在 action chunking 已成为 VLA 标配的今天,「一次执行多少步」几乎被所有工作当作一个固定的超参数。北京大学与微软亚洲研究院的一项新工作指出:这个默认设定本身就是一个重要的失败原因 —— 它让重规划变成了与任务进度无关的周期性调度,当没有任何一次重规划恰好落在关键操作阶段之前时,机器人只能带着一个已经过时的 chunk 进入关键操作环节。 研究团队提出了 Berno u lli-Continuation Policy(BCP) : 冻结基座 VLA,仅训练一个 16.4M 参数的轻量级 head,把「执行多久」分解为一系列「继续执行还是重新规划」的伯努利决策,并通过 GRPO 从轨迹级结果中进行优化。在 RoboTwin 2.0 全部 50 个任务上,LingBot-VLA 的平均成功率从 89.88% 提升至 93.94%, 在 VL A 方 法中取得 SOTA ;真机挂马克杯任务的成功率则从从 44% 提升至 84%。 论文标题:Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution arXiv:2608.03483 项目主页:https://fleetfootwork.github.io/BCP/ 一、研究背景:被当成工程细节的决策维度 Action chunking 让 VLA 一次预测未来一段动作序列,而不是逐步预测单个动作,既降低了模型推理的频率,也改善了动作的时序一致性。在 chunk-based VLA 中有两个 horizon: prediction horizon 决定模型一次生成多少步动作, execution horizon 则决定这些动作中有多少步会被真正执行,执行完机器人再重新观测并规划。 OpenVLA、π_0.5、LingBot-VLA 等主流工作都采用固定的 execution horizon。这在自由空间中的粗粒度运动阶段问题不大——长序列往往更加平滑、稳定;但到了接触、对齐、夹爪闭合这类对精度敏感的阶段,微小的位姿误差就可能迅速累积,机器人必须在进入这些阶段之前重新观测。而固定的重规划节奏无法保证这一点。 为了量化这一现象,研究团队设计了一个 phase-shift 实验 :所有变体都使用完全相同的 50 步 horizon,唯一的区别在于第一个 chunk 只执行 φ 步就重新规划,此后仍然每 50 步规划一次。换句话说, 模型和 horizon 都完全相同,只有重规划边界的落点不同 。 RoboTwin 2.0 的 50 个任务上的结果如下所示: 最高和最低之间相差 11.3 个百分点,需要注意的是,这里 Upper / Lower Bound 都是 hindsight oracle,在真实部署时不可能提前知道。但这个结果说明了一件很关键的事: replanning timing 本身就是一个很强的决策变 量 。 在 Placing Dual Shoes 任务上,这种差异表现得非常直观:当 φ=32 时,机器人执行了一个已经过时的夹爪闭合动作,最终导致任务失败;而当 φ=23 时,恰好有一次重规划落在关键操作阶段之前,机器人获得了新得观测,因此能够准确完成抓取动作并成功执行任务。同一任务上,最佳相位的成功率为 92%,而最差相位只有 80%。 图 1 同一模型、同一 50 步 horizon,仅改变重规划边界的落点:φ=32 时夹爪闭合幅度过时导致失败,φ=23 时边界恰落在操作阶段前而成功。成功率随相位在 0.80–0.92 间剧烈波动。 更重要的是,最优相位 不存在可复用的规律 。论文统计了 50 个任务各自的最佳 φ,并做卡方拟合优度检验:χ² = 5.00,p = 0.287,无法拒绝均匀分布的原假设。关键时刻在不同任务、不同阶段出现在不同时间,因此不存在一个固定相位能对齐所有精度敏感阶段。 由此论文提出了核心问题: 给定一个已预测的 action chunk,机器人应该执行多久再停下来重规划? 二、方法:三个挑战与三个设计 学习这样一个策略并不容易,论文明确列出三个挑战,并逐条给出对应设计。 图 2 BCP 框架。冻结的 VLA 预测定长 action chunk,Bernoulli-Continuation Head 复用其表征输出一串「继续概率」,据此选定执行 horizon;整体用 GRPO + Replanning-Efficiency Reward 优化。 2.1 候选 horizon 具有前缀共享结构 执行 40 步与执行 50 步时,前 40 个动作完全相同,两者的区别只在于第 40 步之后是否继续执行。标准 softmax 分类器却会把不同候选 horizon 看成彼此独立、无序的类别,从而完全忽略这种天然的前缀共享结构。 Bernoulli-Continuation Head 的做法是:输出 M−1 个 logit,经 sigmoid 得到「继续概率」 σ 其中, 表示从 horizon 继续执行到 的概率。选择第 k 个horizon,就等价于连续通过前 k−1 次「继续」决策,并在第 k 个位置停止: π θ 这种因子分解与 chunk 执行天然具有的嵌套结构高度一致: 只有当前 chunk 被连续判断为可信,策略才会逐步走向更长的 horizon;与此同时,相邻 horizon 也天然具有更接近的概率 ——这正是传统分类策略所缺失的序数归纳偏置。 在具体实现上,这个 head 不需要额外进行一次 VLA 前向推理 。它复用 VLA 在预测 action chunk 时已经生成的三类表征: VLM token 、 每个动作步 对应 的去噪动作 、以及其 最后一步的动作速度特征 。三类表征拼接并投影后,在前面加入一个可学习的 [CLS] token,再经过一个 2 层的 Transformer encoder,最终映射为 M−1 个 logit。 2.2 per-chunk 监督不可辨识 每一次 horizon 决策都会与后续 chunk 以及之后的决策相互耦合。同一个最终结果可能由多种不同的 horizon 序列产生, 因此并不存在唯一的 ground-truth 停止标签 。基于这一点,研究团队放弃了监督学习,使用 GRPO 从轨迹级结果中进行优化。 对于每个任务实例, π θ 采样 G−1 条自适应轨迹, 同时额外 rollout 一条使用固定 horizon 的参考轨迹 τ 用于锚定 advantage : Â , τ 本身不包含任何 BCP 决策,不参与参数更新,只提供一个相对于固定策略的稳定参照。整个训练过程中,底座 VLA 始终保持冻结。 2.3 纯成功率奖励会导致 horizon 塌缩 短 horizon 天然更加保守。如果只使用二值成功率作为奖励,策略很容易退化成频繁重规划,从而浪费昂贵的 VLA 调用。为此,论文设计了 Replanning-Efficiency Reward(RER) 。 首先定义相对效率项,其中 C 表示 VLA 的调用次数,tanh 用
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱