首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent

摘要

GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent 思邈 2026-09-21 14:22:37 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号QbitAI Codex、Claude Code等数字世界智能体,已经向我们展示出了一种全新且高效的工作方式:大模型理解目标,拆解任务,调用适当的工具,并根据执行结果不断调整计划,直到完成任务。 随着GPT-6 Astra开始接...

量子位 随着GPT 调用能力 GPT Astra开进机器人身体 清华联手无问芯穹等开源RPent 2026 凹非寺 公众号QbitAI Codex
2026-09-21 1 阅读 约9分钟阅读 思邈
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent 思邈 2026-09-21 14:22:37 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号QbitAI Codex、Claude Code等数字世界智能体,已经向我们展示出了一种全新且高效的工作方式:大模型理解目标,拆解任务,调用适当的工具,并根据执行结果不断调整计划,直到完成任务。 随着GPT-6 Astra开始接受真实机器人操作测试,这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。 同时,也让一个曾经遥远的问题变得越来越具体: 通用大模型,能否成为机器人的“大脑”,让机器人真正完成现实世界中的复杂任务? 但机器人面对的不是可以随时回滚的代码,在物理世界里,环境持续变化、状态无法完全观测,动作一旦发生也很难轻易撤销,抓取、装配、插拔等精细操作更需要专门的模型与控制能力。 物理世界中的智能体,不只是 “想明白” ,还必须“ 看得见、做得到、反应快”,并且“记得住”。 今天,由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。 RPent面向真实物理世界,将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来, 形成从感知、决策、执行到反馈纠错的完整闭环,使智能体能够持续适应环境变化,并将经过验证的经验沉淀为可复用的能力,在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率,并将端到端任务完成速度优化7倍以上。 RPent由大规模具身强化学习框架RLinf的核心团队打造,延续了该团队在具身智能基础设施领域的技术积累。 开源代码链接:https://github.com/RLinf/RPent RPent真机效果展示:从“会动”到“会做事” 在这一视频中,RPent展示了多个有趣的开放式任务:机器人将钢珠倒入碗中,双臂协同擦拭盘子,还会主动移开遮挡物,找到藏在碗下的勺子。 值得注意的是,这些任务并不是为每一种场景单独训练一个专用策略。 机器人真正发生的变化,是开始从“执行学过的动作”,走向“理解任务、调用能力,并根据环境变化调整行动”。 1、例如,当任务变化为“将干净餐具放入纸箱”时,面对同一只蓝色盘子,冻结VLA只会沿用训练时学到的动作,将它错误地放入金属篮中; 而在RPent中,智能体会先观察当前环境,再根据新的目标选择放置位置。执行过程中,如果视觉定位出现偏差,它还会检查结果、排除错误目标,并重新定位手中的盘子。 任务变了,机器人也能随之改变行动。 2、另一个任务中,机器人需要读取瓶身和袋子上的品牌标签,将不同饮料放入对应的袋子。 抓起瓶子后,它会先进行小幅试抬,确认夹持稳定; 当原有运动路径不可行时,再调整腕部姿态继续执行。 接着,面对被碗遮挡的勺子,机器人也不会直接尝试抓取,而是先移开两个碗,让目标重新变得可见、可达。 这里展示的已经不再是一条预先写死的动作序列,而是一个完整的“观察-判断-执行-纠错”闭环。 3、最后两个任务则进一步展示了 RPent对已有能力的复用。 机器人可以将原本用于“拿起并放置容器”的技能重新组合,用于 倾倒钢珠 ;又把抓取动作与双臂协同、持续接触组合起来,完成 持盘、擦拭和收纳 。 探索成功后,RPent会把经过验证的任务逻辑沉淀为任务卡(Task Card);再次执行时,RPent可以启用 Flash Mode ,通过任务卡直接复用这套流程,只根据当前视觉状态做必要调整,避免每一步都重新调用大模型,有效降低了具身智能体执行的延时。 这一整套Demo想展示的,并不是“机器人又学会了几个动作”,而是一个更重要的问题 :当机器人走向开放世界,新的任务、物体和障碍不断出现时,它能否像人一样将已有技能重新组织起来,完成训练分布之外的任务? RPent所探索的,正是这样的具身智能体形态。 机器人不再只是执行一条固定指令,而是能够理解目标、调用能力、应对变化,并将一次成功沉淀为下一次可以复用的经验, 这正是具身智能体的雏形。 RPent核心设计思路 当前具身智能的发展,正在逐渐呈现两种不同的技术路线。 一条是 纯VLA端到端。 用一个视觉-语言-动作模型直接吃下观测、吐出动作,精细操作做得很好,但一旦任务变长、语言变花、场景被扰动就迅速退化。 另一条是 纯大模型Agent (如CAP-X这类工作)。 随着GPT-6这一代通用模型对具身任务的覆盖率快速提升,大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。 两条路线之间并非简单的替代关系,而是对应了不同层次的能力: RPent并不是在两种路线之间进行折中,更不是让某一个模型变得无所不能,包办从任务理解到机械臂控制的全部工作,而是将具身智能拆解为不同层次的能力,让不同模型各自承担最擅长的事情: 通用大模型负责理解任务、制定计划; VLA、WAM等专家模型负责高精度动作执行; 记忆系统沉淀经验,推动智能体持续优化; 框架负责连接模型、工具与真实环境,形成闭环。 由此,它们形成 “观察-规划-执行-反馈-再规划”的闭环,让智能体从一次性执行任务,走向在真实世界中持续成长。 其 背后算法,源于团队于7月份提出的Harness VLA工作(链接:https://arxiv.org/abs/2607.08448) 01开放的模块化架构,让模型、工具和硬件各司其职 RPent 采用开放的模块化设计,将系统划分为用户层、智能层、接口层和环境层四大层级。 在用户层,可以通过交互式命令行或Web Dashboard下达任务,并查看视觉输入、推理过程和动作轨迹。 智能层中的规划器结合基础模型、Memory与工具库拆解任务,动作原语则把VLA、WAM和程序化技能封装成可调用工具。 在环境层和接口层,机器人控制、模型服务和仿真环境可以独立部署,通过轻量级通信连接。 上层任务逻辑不必绑定某一种机器人或仿真器,新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境,以及Franka、双臂Franka、YAM、SO101等真实设备。 用户层(User Layer):智能体交互入口 用户层提供类似Claude Code/Codex的交互式CLI,以及可选Web Dashboard。 用户可以下达任务指令,并实时查看智能体推理过程、视觉输入和动作轨迹,实现对智能决策过程的可观测及实时交互。 智能层(Intelligence Layer):任务规划与能力调度中心 智能层由 Agentic Planner 和 Action Primitive 组成。 Agentic Planner结合基础模型、Memory和Tool Library,实现任务理解、规划与工具调用,并通过 Ag
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱