智能AI
morning
PhyAgentOS v1.0.0发布:为物理智能体打造可执行、可验证、可演进的Harness
2026-09-15
1 阅读
约10分钟阅读
机器之心
字号:
最近,一条很科幻的视频在网络上被不断转发: 画面从一条自然语言指令开始:利用现场材料,配制并核验六级 pH 彩虹。没有人为逐步遥控,系统先识别实验台上的物料,再让四足机器人、人形机器人和双臂机器人依次完成扫描、运输、交接与台面操作。三台构型不同的机器人,共用同一个任务上下文。 真正体现系统作用的,是任务中途出现偏差之后。第六支试管的颜色没有达到目标,系统没有把 “动作执行完” 当成任务完成,也没有从头再来,而是保留现场状态,补充缓冲液并重新检测。pH 实测为 11.03、进入目标容差后,任务才通过验证。 支撑这条 “决策 — 执行 — 留证 — 验证 — 修正” 链路的,是 PhyAgentOS v1.0.0:一套由中山大学 HCP 实验室、鹏城国家实验室具身智能研究所与 X-Era Lab(拓元智慧)联合研发的开源物理智能体 Harness。它兼容 VLA、世界模型、仿真与真机,并面向异构机器人提供统一执行基座,也为 RSI(Recursive Self-Improvement,递归自我改进)提供可追踪的工程基础。项目于 2026 年 7 月开源,8 月底发布首个稳定版;截至目前,GitHub Star 已突破 2100。 GitHub:https://github.com/PhyAgentOS/PhyAgentOS-core 项目网站:https://phy-agent-os.x-era.com/ 技术报告:https://arxiv.org/pdf/2607.16636 01 三台机器人接力,失败之后没有从头再来 PhyAgentOS REPLAN³ 实拍演示 这段四分钟左右的演示里,用户只给出最终目标,没有为每台机器人分别编写动作脚本。系统完成环境感知和物料定位后,把扫描、运输、交接和配液等步骤分配给四足机器人、人形机器人与双臂机器人。三者依次接力,上层 Agent 看到的是一个连续任务,而不是三套彼此割裂的设备流程。 前五支试管顺利完成后,第六支试管的颜色与目标不符。这里如果只看控制信号,机器人已经做完动作;但 Verifier 综合现场图像与检测结果,判断任务仍未完成。系统在同一个 AgentTask 中追加 PlanRevision,保留此前动作和当前环境状态,重新补充缓冲液和试剂并再次核验。直到 pH 实测为 11.03、进入目标容差,任务才被标记为通过。 这也把 PhyAgentOS 要解决的问题具体化了:物理智能体不能只会把动作发出去,还要知道每一步有没有证据、最终结果是否达标,以及失败后应该从哪里接着做。任务分解、异构调度、证据采集、结果验证、有限恢复和经验沉淀,构成了这套 Harness 的完整链路。 图 1|PhyAgentOS v1.0.0 总体架构:Forge 统一物理执行,验证与经验回流构成两条可信闭环。 02 结果验证与受控恢复:从 “动作结束” 到 “任务完成” 传统控制链路往往把设备返回的完成信号视为任务结束,但 “夹爪已闭合” 并不能证明目标物抓取成功,“指令已接收” 也不能证明用户目标已经达成。PhyAgentOS 将执行事实、现场证据与任务结论拆开:Query、Action 和 Session 记录工具调用及执行状态,Evidence 模块保存动作前后的图像、检测结果与设备状态,任务级 Verifier 再依据目标、成功标准和证据时序,给出 success、failure 或 replan required 的结论。 图 2|任务契约、执行事实与现场证据共同进入 Verifier,输出可检查的任务级结论。 当验证未通过时,恢复过程仍属于原 AgentTask。系统基于既有工具轨迹、证据链与最新环境状态追加 PlanRevision,而不是重新创建任务或盲目重试。这样既保留了状态连续性,也能限制恢复范围和重试次数;视频中仅重做第六支试管,正是一次有界恢复。 基准测试进一步量化了这套机制。在 LIBERO 的 2000 个 Episode 中,X-VLA 首次成功率为 97.3%;PhyAgentOS 对 54 个首次失败样本进行分析与恢复,挽回 26 个,最终成功率提升至 98.6%。系统未修改策略模型代码,也没有把恢复过程记作新的 Episode。在 CALVIN 五步长程任务上,完整链路最高提升 4.1 个百分点;在 RoboCasa365 上,RLDX-1 与 WorldDreamer 分别提升 7.2 和 8.4 个百分点。 图 3|First attempt 与 Final outcome 分开统计,用于区分策略原始能力和系统恢复收益。 03 经验回流:用验证结果驱动 Skill 持续演进 结果验证不仅决定任务是否结束,更是经验进入系统的第一道门槛。PhyAgentOS 以通过验证的完整任务为基本样本,将目标、计划修订、工具轨迹、证据指纹与最终结论整理为 TaskEpisode,再进入经验提炼流程。没有证据支撑或尚未闭环的执行记录,不会直接转化为新能力。 经验提炼后形成两类候选结果:稳定、可复现的工作流可晋升为 SkillCandidate,反复出现且能够归因到工作流的问题可聚合为 Lesson。设备掉线、网络抖动、传感器噪声或证据不足等环境异常只保留诊断信息,不进入经验库。Skill Runtime 则负责检查技能制品、依赖环境、健康状态与生命周期,确保 “知道怎么做” 和 “当前能不能做” 保持分离。 候选经验正式生效前还要经过多任务佐证、结构校验与安全检查。系统会过滤具体坐标、凭据、临时设备 ID,以及任何试图绕过 Forge 或 Verifier 的指令,避免一次偶然成功污染已有能力。由此,Evolution 模块沉淀的不是原始日志,而是来源可追踪、条件可检查、能够在后续任务中复用的经验。 图 4|Verified AgentTask 经 TaskEpisode、反思归因与多次独立支持后,才进入 Skill 或 Lesson。 04 Forge 执行框架:统一异构机器人的物理动作入口 Forge 是一个面向 Physical AI 的通用机器人控制底座,用统一的机器人、传感器、环境抽象,把硬件和算法策略组织成可组合、可复用、可被结构化调用的能力。 现实场景里的机器人很少来自同一家厂商。仓库中,四足机器人可能负责穿过狭窄通道巡检;机械臂负责在固定工位抓取和放置;人形机器人则更适合操作原本为人设计的按钮、柜门或工具。它们使用不同控制接口、传感器和软件环境,过去若要协同,往往需要为每一种机器人单独开发和调试。 PhyAgentOS 的一个核心亮点,是以统一协议把异构机器人接入同一套任务系统。上层 Agent 不需要逐一理解不同机器人的控制细节,只需调用标准化的 Tool;底层 Forge 则负责识别设备能力、路由任务、下发指令并管理执行状态。 例如,门店系统给出 “完成 A 区货架巡检与缺货复核” 的任务后,四足或轮式机器人可以负责移动和采集图像,视觉能力负责识别货架状态,机械臂在具备条件的场景中再完成取放或补货。系统关注的是任务有没有完成,而不是操作者必须手动切换三套设备控制台。 统一协议的价值,不在于让所有机器人变得一样,而在于让
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱