智能AI
morning
VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错
2026-09-06
1 阅读
约9分钟阅读
机器之心
字号:
机器人抓住积木,正准备往碗里放。就在这时,有人突然把碗挪走了。 人会本能地停一下、看一眼,再重新对准;但不少 VLA 机器人不会。它明明还在接收相机画面,手上却继续执行几百毫秒前生成的旧动作,最后把积木放进空气里。 这不是模型「没看见」,而是它在这段时间里,根本没被允许重新思考。 浙江大学 ACES 实验室 OmniAI 团队与阿里巴巴达摩院的最新工作 VLA-Corrector ,盯住了这个长期被 action chunk 掩盖的问题:VLA 一次预测一串动作确实高效,但从开始执行到下一次推理之间,也出现了一块危险的 开环盲区 。 论文: VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon 作者: Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang 单位: Zhejiang University;Alibaba DAMO Academy 论文链接: https://arxiv.org/abs/2607.01804 项目主页: https://zju-omniai.github.io/vla-corrector/ 代码: https://github.com/ZJU-OmniAI/vla-corrector 他们给出的答案很直接:不必逼大模型每一步都重算,也别让机器人闭着眼把整段动作做完。给 VLA 加一个约 40M 参数的轻量级 Corrector,让它知道什么时候该继续,什么时候必须停手纠错。 长 action horizon 与严格闭环执行的对比 VLA 明明一直睁着眼,为什么还像没看见? 现在主流的生成式 VLA,常用 action chunk 来摊薄推理成本:模型看一次画面,一口气生成未来一段动作;机器人再从中连续执行前 H 步。H 越大,调用模型的次数越少,动作也更连贯。 代价同样明显。抓取时打滑、插入时偏了两毫米,或者目标被人移动,后面的动作就已经「过期」了。但只要 horizon 还没结束,机器人仍会照着旧计划往下做。小偏差很快滚成大错误,等下一次推理终于到来,状态可能已经偏到救不回来了。 把 H 设成 1,当然可以步步闭环,却等于每个控制步都调用一次 VLA。论文的 horizon sweep 也把这笔账算得很清楚:以 π0.5 为例,拉长 horizon 能把 policy call 降低约 4 倍,但成功率会从约 64% 掉到 49% 以下。 所以,问题并不是再猜一个「最佳 H」。真正该问的是: 当前这段动作,什么时候已经不值得信了? 不要一直重规划, 只在动作失效的那一刻接管 VLA-Corrector 没有改动 VLA 主干权重,而是在推理链路外加了一条「监测—打断—纠正」的旁路。 第一步是监测。Latent-space Vision Monitor(LVM)学习一个很局部的问题:执行这个动作后,视觉特征接下来应该往哪个方向变化?在线运行时,它不断比较「预期变化」和相机里「真实发生的变化」。模型不是直接预测像素,而是在信息密度高的 latent space 中预测视觉动态残差。这样有助于减少静态背景,光照的干扰,让模型优先关注对执行任务而言重要的动态部分,降低学习难度的同时还能让预测更加准确。 第二步是打断。如果这种偏差持续出现,而非单帧抖动,系统立刻清空队列中尚未执行的 stale actions。动态阈值、迟滞机制和连续步检查,保证它不会一有风吹草动就停机。 第三步才是纠正。简单地再问一次 VLA,可能只会得到另一段同样出不去的动作。为此,Online Gradient Guidance(OGG)会把刚才检测到的视觉偏差变成梯度信号,只引导中断后的那一次恢复推理,把新动作往更可恢复的方向推。 VLA-Corrector:监测、打断与纠正 这套机制最终得到的不是另一个固定 horizon,而是 事件触发的自适应 horizon :搬运平稳时,大步往前走;到了抓取、对齐、插入这些容易出错的阶段,随时准备切回短视野纠错。实验中,83.7% 的截断恰好发生在这些关键阶段。 换句话说,它不是在开环和闭环之间二选一,而是把闭环反馈用在了最值钱的时刻。 成功率涨了,调用次数反而还能降 在 MetaWorld 上,给 π0.5 加入 VLA-Corrector 后,平均成功率从 48.70% 提升到 64.35% ;在 Very Hard 任务上,提升达到 24 个百分点 。 更有意思的是,它并不是靠疯狂增加推理次数换来的。SmolVLA 在 horizon 10 下,成功率从 61.90% 提升到 73.00% ,平均 policy call 却从 19.27 次降到 15.64 次 。原因不难理解:及时扔掉过期动作,远比在失败轨迹上继续浪费整段 chunk 划算。 真实 AgileX PiPER 机械臂上的结果更直观。九项任务的平均成功率从 55.6% 提升到 73.3% ;在人为移动物体或目标的扰动恢复任务中,成功率从 40.0% 跃升到 68.3% 。而在 LIBERO 上,加入 Corrector 的 few-shot 模型达到 97.8% ,还超过了 fully fine-tuned baseline 的 96.95%。 VLA-Corrector 的真实机械臂结果 这项工作真正值得带走的 insight 过去我们常把 VLA 的可靠性理解成「第一次就预测出完美动作」。但机器人进入物理世界后,动作会反过来改变环境,计划也会随时过期。一个永远不犯错的长动作块并不现实,真正重要的是:系统能不能尽早知道自己已经走偏,并保留打断自己的权力。 VLA-Corrector 给出了一种很有启发的系统分工: 大模型负责提出计划,小模型负责审计计划,执行层拥有随时叫停的权力。 这可能比一味堆大 backbone 更接近具身智能的可靠落地。 它当然不是万能恢复器。OGG 仍受基础策略能力上限约束。但VLA-Corrector真正的核心在于它能有效抑制错误在开环盲区中被放大,大幅降低VLA policy从错误中恢复的难度。它改变了问题的解法:不再要求 VLA 时时严格闭环,而是让系统在该闭环的瞬间,真的闭上这个环。 一句话概括: 机器人未必需要永远不出错,但它必须学会不把错误继续做完。 作者介绍 本工作由浙江大学 OmniAI 团队与阿里巴巴达摩院联合完成,第一作者是浙大准研一的硕士研究生潘翼,研究聚焦 action-chunked VLA 的开环盲区与真实机器人纠错,通讯作者为浙大百人计划研究员张文祺。 © THE END 转载请联系本公众号获得授权 投稿或寻求报道:liyazhou@jiqizhixin.com 平台地址: http://www.jintiankansha.me/t/aQ5FxEuUkk
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱