首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

2026-09-16 1 阅读 约10分钟阅读 机器之心
分享:
字号:
真实家庭任务往往从「不完整的信息」开始:机器人不知道目标在哪里,用户也未必能一次说清自己想要什么。面对「帮我从餐桌上拿点零食」这样的模糊指令,机器人不仅要主动寻找候选物体,还要在发现面包和多个甜甜圈后进一步询问用户,确认究竟该拿哪一个。 在真实世界里,探索环境、理解意图和执行动作,本就不是三个彼此独立的问题。 围绕这一问题,来自上海交通大学、上海人工智能实验室等机构的研究者提出 REAL ,一个面向开放世界移动操作的可探索、可交互、可部署的视觉具身智能体框架,并构建了贯穿仿真、数据生成、模型训练、系统评测与真机部署的完整技术链路。这篇工作已被 ECCV 2026 接收。 📄 论文链接:https://arxiv.org/abs/2607.13653 🏗️ 项目主页:https://internrobotics.github.io/REAL/ 💻 开源代码:https://github.com/InternRobotics/REAL 一、从仿真到真实世界: 没有「上帝视角」,也没有「完美指令」 面向从仿真到真实世界的迁移,REAL 重点针对现有具身智能体仿真环境中两项被过度理想化的假设: 环境信息充分可知 与 用户意图清晰明确 。而在真实部署中,智能体往往面临相反的情况—— 环境未知 ,机器人缺乏先验感知;以及 意图模糊 ,用户难以在任务开始时一次性明确需求。具体而言: 首先是 环境状态信息缺失 。现有仿真环境通常通过特权感知接口(oracle perception API)提供任务相关物体的数量、位置等真实信息,但在真实环境中这些信息无法被直接获取,智能体需要依靠主动探索发现物体。依赖特权信息训练得到的智能体,在真实部署中往往缺乏自主感知与探索能力。 其次是 用户意图信息模糊 。现有的具身智能体评测任务通常假定指令是清晰明确的,但真实场景下的用户未必知晓环境全貌,往往只能给出模糊需求,并根据智能体的反馈逐步细化任务。因此,真实环境下的智能体需要能反馈当前环境状态,并按照用户需求调整后续行为。 为应对这两类不确定性,REAL 将主动探索、视觉目标定位、自然语言意图消歧和物理操作统一到同一决策闭环中:系统以第一视角 RGB 观测为主要感知输入,并结合建图系统提供的承载区域(如桌面、柜子)作为搜索先验;当智能体在探索阶段发现多个候选目标时,智能体会主动汇报探索结果并请求用户细化指令(例如:「我找到了一个面包和两个不同的甜甜圈,您想要哪一个?」);智能体的询问由当前探索结果触发,用户反馈则进一步细化任务目标。通过这一机制,环境探索、意图确认与物理执行被统一到同一决策闭环中。 图 1. REAL 的工作模式与既往执行方式的对比 二、REAL: 面向开放世界移动操作的 Agentic 架构 REAL 构建于 InternUtopia 仿真平台之上,利用其高保真渲染能力、丰富的可交互仿真场景与资产,设计了适用于移动操作智能体的数据采集、训练和评测管线,最终形成了一套面向开放世界移动操作的 Agentic 框架。该框架的系统顶层架构由以下三大核心组件构成: 大脑: 智能体采用 Qwen3-VL-8B-Instruct 作为骨干视觉语言模型。大脑负责处理多模态观测信息、维护结构化的自摘要历史状态,并进行高层任务规划与工具调用。 工具与接口: REAL 环境提供了一套不依赖特权感知信息的标准化工具链,主要包含:用于主动获取环境信息的四步探索工具( Nav_to 、 Walk_around 、 Show_object_by_category 、 Gaze_at ),用于底层物理执行的控制接口( Pick 、 Place 、 Open 、 Close ),以及用于发现歧义并提问的主动交互工具( Ask )。为了实现工具的有效组织,框架引入了模型上下文协议(Model Context Protocol,MCP)作为统一的接口标准。高层大脑只需输出离散工具调用,通过 MCP 服务器下发并执行,从而实现了认知规划与底层执行的解耦。 状态与记忆: REAL 环境将 MCP 工具的返回结果组织为结构化多模态信息作为智能体的感知信息,其中包括视觉分割掩码及对应的物体类别、原始 RGB 观测、用户反馈,以及智能体自主总结的任务子目标和历史状态。这种设计在保留有效观测信息的同时,也有助于智能体始终围绕原始任务目标进行决策。 图 2. REAL 框架设计 基于这一顶层架构,REAL 在环境、数据与部署层面实现了三项核心贡献: 无需特权感知的物理仿真环境: 仿真器去除了直接定位目标的特权感知接口,要求智能体依靠工具链在场景节点中自由探索。同时,环境还引入了模拟 用户 ,使智能体能够在执行中动态询问并对齐意图。 自动化数据生成与双阶段训练管线: REAL 基于场景与资产自动组合任务,通过规则规划器生成可执行的专家轨迹,再利用 Gemini 3 Pro 模型为轨迹补充逐步推理和结构化历史状态。在此基础上,团队采用监督微调训练智能体的基础工具调用能力,并进一步通过在线强化学习训练其闭环探索、错误恢复与主动询问能力。 统一接口下的仿真到现实部署: 团队构建了包含 241 个任务实例的 REAL-Bench 以验证实际效果。得益于 MCP 协议,同一套高层策略能够零样本迁移至真实的双臂移动机器人,验证了框架的可部署性。 三、技术实现: 主动探索、沟通与高低层解耦 无特权感知的主动探索与交互 在 REAL 框架中,智能体仅接收可获取的结构先验,即承载区域或场景节点(如桌面、柜体)的 ID 与语义类别。为了定位目标,智能体通过 四步探索工具链 (导航、多视角扫描、目标检测、对齐注视)主动获取视觉信息。系统将检测到的 2D 分割掩码反投影到 3D 空间以构建临时探索地图,并通过 SoM(Set-of-Mark)为物体分配视觉 ID。后续的抓取、放置等操作均基于视觉 ID 调用,使机器人能够完成 视觉目标定位与消歧 ,有效区分同类但外观不同的物体。同时,REAL 接入了一个由大模型驱动的模拟用户,它能依据当前已发现的物体和任务配置给出回答,使主动沟通成为由探索结果直接触发的执行环节。 基于 MCP 协议的高低层解耦执行 得益于 MCP 协议的引入,模型「大脑」可以始终专注于任务规划与状态跟踪,并输出统一格式的离散工具调用。在此机制下, 仿真环境与真实环境通过统一的工具接口被抽象为一致的交互空间 。 当系统迁移到真机部署时,底层的连续物理控制由微调后的 $\pi_{0.5}$ 模型等专门的物理技能来接管。这种高低层解耦的设计,使得高层策略在完全不重新训练的情况下,就能直接零样本迁移到真实的物理机器人上。 SFT 与 GSPO:先完成工具对齐,再学习闭环决策 智能体采用 Qwen3-VL-8B-Instruct 作为基座模型,以兼顾多模态能力与机器人侧的推理效率。针对长程任务中容易出现的上下文膨胀问题,系统将决策过程建模为部分可观察马尔可夫决策过程,并使用结构化的自摘要历史状态,避免了在每一步重复拼接完整的交互轨迹。整个训练管线分为两个核心阶段: 监督微调(SFT)实现工具对齐: 在该阶段,系统利用规则规划器生成专家轨迹,并通过自动化标注模块将部分清晰
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱