首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

AdaRoboVLG:适用于不同机械手的任务自适应视觉语言抓取框架

摘要

AdaRoboVLG:适用于不同机械手的任务自适应视觉语言抓取框架 同样是一只杯子,机器人到底应该抓哪里? 如果任务是把水倒进水槽,握住杯柄通常更合适;如果要把杯子递给别人,机器人最好把杯柄留给对方;如果杯子还在传送带上移动,抓取位置又必须随时间不断更新。周围堆放的杂物、目标遮挡和不同机械手的结构差异,又让一个看似简单的「伸手拿杯子」,变成空间、语义与动态控制交织的问题。 视觉 — 语言抓取(Vi...

AdaRoboVLG https github CGR Vision Language Grasping VLG Grasp Wang
2026-09-25 1 阅读 约10分钟阅读 机器之心
分享:
字号:
AdaRoboVLG:适用于不同机械手的任务自适应视觉语言抓取框架 同样是一只杯子,机器人到底应该抓哪里? 如果任务是把水倒进水槽,握住杯柄通常更合适;如果要把杯子递给别人,机器人最好把杯柄留给对方;如果杯子还在传送带上移动,抓取位置又必须随时间不断更新。周围堆放的杂物、目标遮挡和不同机械手的结构差异,又让一个看似简单的「伸手拿杯子」,变成空间、语义与动态控制交织的问题。 视觉 — 语言抓取(Vision-Language-Grasping,VLG)的目标,正是让机器人根据自然语言和具体情境,做出符合任务意图的抓取。这需要同时处理空间、认知、时序与本体四类挑战:找准目标并避开碰撞,理解物体用途,追踪持续变化的状态,还要适应不同机械手。 当前不少 VLG 方法采用端到端路线,直接将视觉观察和语言指令映射为抓取动作。这类策略的适应能力往往受训练数据与机械手配置限制;面对新的任务情境与本体,通常需要补充数据或重新训练。 来自华中科技大学、北京大学、擎朗智能等机构的研究者提出了 AdaRoboVLG 。该框架将「任务需要怎样抓」与「机械手如何稳定抓取」解耦,并用统一的抓取接口连接任务理解与物理抓取合成:上层把任务情境转化为抓取约束,下层据此为不同机械手生成稳定姿态。由此,新能力可以接入同一抓取底座,形成一条 可扩展的机器人抓取(scalable robotic grasping) 的路线。 标题: Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis 作者: Sixu Yan, Shikang Wang, Binhua Huang, Xuanlai Tang, Guohua Fan, Fan Huang, Haoxuan Li, Yongkang Li, Yuhan Li, Bencheng Liao, Zeyu Zhang, Wenyu Liu, Hangxin Liu, Xinggang Wang 论文: https://arxiv.org/abs/2609.04096 主页:https://adarobovlg.github.io/ 代码:https://github.com/AdaRoboVLG/AdaRoboVLG 仿真:https://github.com/AdaRoboVLG/AdaRoboVLG-Playground 01 把理解与抓取拆开, 让同一底座服务不同机械手 人类之所以能在遮挡、功能需求和目标运动等挑战同时出现时灵活调整抓取,并不是因为经历过每一种可能的情形,而是会调用由常识和过往经验形成的丰富先验,协同完成感知、推理与动作控制。基础模型在视觉识别、空间理解、功能推理和目标跟踪等方面展现出与这些先验相似的能力。受此启发,AdaRoboVLG 将基础模型提供的先验转化为可组合的抓取约束,再交给可跨机械手复用的基础策略,生成符合任务意图且物理可行的抓取姿态。 人类利用常识与经验调整抓取;机器人组合视觉、分割与语言模型先验 抓取约束被定义为一组 统一的抓取接口 ,它由目标物体几何、接触抓取表示(Contact Grasp Representation,CGR)和与机械手兼容的抓取类型组成。CGR 描述接触位置、概率、接近与闭合方向以及抓取宽度;抓取类型来自人类抓取分类,并依据机械手的运动能力进行筛选。 AdaRoboVLG 总体框架:可组合先验通过结构化接口连接基础抓取策略 基础策略先根据 CGR 和抓取类型,为具体机械手生成候选;再由共享模型进行稳定性评分。评分采用的手 — 物交互表示(Hand-Object Interaction Representation,HOI)编码接触点的位置、法向等局部几何信息,为力闭合相关的稳定性预测提供依据。不同机械手按自身结构生成候选,共享模型负责评分;接入新机械手时,只需配置对应的运动学映射和兼容抓取类型。 研究团队在 Isaac Sim 中使用 DH3、Allegro、Inspire 三种机械手,采集了 440 万次带标注的抓取试验, 用于训练基础抓取策略。 基础策略的仿真数据采集流程 实验一验证了学习效率与跨手预测能力。相比独立编码手与物体,HOI 收敛更快、训练损失更低;三手联合训练的模型在 DH3、Allegro、Inspire 上分别达到 82.95%、88.02%、91.07% 的抓取质量预测准确率。 基础策略实验:训练收敛(左)与跨机械手预测准确率(右) 02 三类先验,分别回答 「能不能抓、该怎么抓、如何跟上」 在基础策略之上,空间、认知和时序先验负责把任务情境转成接口约束。实验二至四先分别检查每种能力,为后面的真实系统组合提供依据。 空间先验:杂物之间,机械手能否伸进去? 一个姿态即使能抓牢目标,也可能与周围物体发生碰撞。空间先验利用多视角彩色与深度(RGB-D)观察,将 DINOv3 提取的图像特征提升到三维,形成场景级语义表示;再结合点云,通过 Contact-GraspNet 预测场景级 CGR,为基础策略提供接触候选。 空间先验:DH3、Allegro、Inspire 在六个场景中的抓取可视化。 同一场景中的接触候选,可以根据不同机械手的结构映射为不同姿态。空间模块中的 Contact-GraspNet 在 GraspClutter6D 上训练,随后用于以下基准评测。 在 DexGraspNet 2.0 的三种杂乱程度与三种机械手上,AdaRoboVLG 平均成功率为 88.4% 。它在 Random、Loose 划分上取得表中最佳结果;Dense 划分则仍有对比方法更高。 DexGraspNet 2.0:多指抓取成功率 AnyDexGrasp* 保留原候选生成流程,使用本文的共享抓取判别模型评分。 认知先验:先推断功能,再验证目标抓取 功能性抓取既要理解任务需求,也要定位、分割对应部位,生成物理可行的抓取姿态。论文通过开放集功能推理与语言引导目标抓取两项互补实验,分别检查推理能力与抓取落地能力。 任务 A:开放集功能推理。 下面展示 16 个物品的功能推理结果:给定任务指令与输入图像,推理出相应的功能部位与抓取类型。 开放集功能推理:16 个物品的部位与手型选择 开放集评测包含 125 组图像 — 指令对、57 种操作任务与 80 类物体。基础 LLM 的功能部位、抓取类型准确率分别为 82% 和 63%;加入 RAG 与 CoT 后提升到 94% 和 87% 。在这组消融实验中,CoT 对功能部位判断的改善更明显,RAG 对抓取类型选择更有帮助。 开放集功能推理消融实验 任务 B:语言引导的目标抓取。 在相同认知模块提供的目标定位与分割结果下,比较各方法能否生成成功抓起目标的姿态。 语言引导的目标抓取:Allegro 四指机械手。 AdaRoboVLG 在 GraspClutter6D 和 GraspNet-1Billion 上的三手平均成功率分别为 81.3% 和 86.0% ,在表中两组基准、三种机械手上均取得最高成功率。 语言引导目标抓取:两个数据集、三种
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱