首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

机器人也有“Aha Moment”!Zetta ζ 闭环物理智能体在线学习

2026-08-18 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 端到端策略模型在物理世界频频失灵,研究者转向 “大模型智能体 + 工具调用” 自救,试图在动态物理世界中持续学习。然而, 这条在线学习路径在物理世界仍未真正走通 。挑战在于,真实物理环境高速变化,现有物理智能体只能在任务失败后复盘整段轨迹,难以在执行现场根据状态变化实时判断、纠错和学习。 清华 AIR 与域变换联合推出 Zetta ζ ,通过演进可高频执行的 critics,闭环物理智能体的在线学习:机器人不再只是事后总结失败,而是在执行过程中持续观察环境、触发恢复,并把 rollout 经验沉淀为可复用技能。 实验显示,Zetta ζ 的任务成功率会随着自探索经验持续提升,在有限 rollout budget 下 LIBERO PRO 和 RoboCasa 分别取得 90.8% 和 93.6%,远超现有其他方法。更惊艳的是, 研究者捕捉到机器人的 “Aha Moment” , 这让研究者看到了 物理智能体 scaling intelligence 的新起点。 项目信息 项目名称:Zetta ζ 发布机构:清华 AIR、域变换 Z-Trans 论文题目:Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence 项目主页:https://AIR-embodied-brain.github.io/zetta/ 01 一个常见的机器人失败场景 想象一个很日常的机器人任务:拿取水杯。 物理智能体系统理解了这个指令,也做出了看似合理的抓取动作。但真正执行时,问题出现了: 抓取力度太大,水杯直接抓坏; 接近目标时姿态偏了,怎么都放不进去; 智能体缺少在线反馈,无法调整。 为什么? 因为现有具身智能系统大多还是 “静态、开环” 的。它们能执行固定技能,却很难在物理执行过程中实时感知异常、主动修复并把失败经验转化为下一次可复用的能力。 物理世界是动态变化的,而大模型的反思往往发生在一次 episode 结束之后。 智能体无法在线测试备选动作,以此验证反思结果是否正确;对完整轨迹做信用分配存在较大难度,同时回溯分析往往无法获取故障发生瞬间的精确状态。 Zetta ζ 要解决的,正是这个问题。 02 Zetta ζ:闭环物理智能体在线学习 Zetta ζ 是清华与域变换联合推出的 闭环在线学习自进化物理智能体 。Zetta ζ 能监督机器人每一步动作的执行,根据反馈生成下一步的执行,并渐进式学习监督和恢复技能,提炼可泛化、可复用的成功经验,让智能体越做越好。 为了加速进化,研究团队还为 Zetta ζ 研发了 Z-Infra,首个为物理智能体设计的 rollout 系统,通过解耦智能体和底层硬件,在各类异构设备上管理调度环境、模型、工具等资源需求,让自进化过程跑得更快、更省、更可扩展。 Zetta ζ 在线自主学习演进,破解具身智能落地难题: 03 Zetta ζ 演进的三个闭环 Zetta ζ 的核心是三个不同时间尺度的闭环,它们共同构成了一个 “自进化飞轮”。 第一环:Critic-Governed Action Loop(动作级闭环) 在动作执行频率上,Zetta ζ 的运行时批评者会持续监控机器人的物理状态。一旦发现异常,比如抓取滑落、接触丢失、运输停滞,系统会立即触发恢复动作,而不是等到整个 episode 失败后再反思。恢复完成后,还有一道严格的 “VLA Re-entry Contract”:只有确认故障已被清除、物理状态恢复稳定,控制权才会交还给原来的 VLA 模型。这相当于给机器人配了一位在线监测的安全员。 第二环:Rollout-Batch Candidate Optimization Loop(批量候选优化闭环) 机器人执行完一批任务后,Zetta ζ 会对失败轨迹进行聚类和因果诊断。它不只看 “任务最后有没有成功”,而是定位 最早偏离正常状态的时间点 ,并渐进式沿着 “评估 → 批评者 → 状态表征 → 规划控制 → 恢复 → 参数” 的层级,找到真正需要修复的根因。随后,系统会自动生成候选的 critic、recovery 和 tool 更新。 第三环:Validation-Gated Skill Update Loop(验证门控更新闭环) 候选更新不能直接上线。Zetta ζ 会先做历史回归测试,再在严格隔离的 held-out 数据上验证。只有那些 真正提升成功率、并且能泛化到新场景 的更新,才会被写入技能记忆库。这保证了机器人不会为了 “背下某个失败样本” 而过度拟合。 04 机器人的 “Aha Moment” 在 Zetta ζ 的进化过程中,研究者观察到一个非常有意思的现象: 成功率不是平滑上涨的,而是先经历平台期,然后突然跃升 。就像人类解题时突然想通了一样,机器人也会出现 “顿悟时刻”。 如图展示的两个典型例子: 把酒瓶放进碗里:成功率从 15% → 95% ; 把奶油奶酪放到碗里:成功率从 5% → 90%; 在具身基准 RoboCasa 上,开电水壶、推洗碗机抽屉、关烤箱门、放置咖啡壶等任务,也出现了类似的跳跃式提升。以放置咖啡杯(CoffeeSetupMug)的任务为例: Round0 :策略模型能够正确识别咖啡杯和咖啡机,并开始执行运输;但在接近咖啡机时,由于缺少对抓取保持和碰撞间隙的持续检查,机械臂发生碰撞并丢失咖啡杯。策略模型未能及时识别这一局部物理异常,最终导致任务失败。(SR:70%) Round1 :Zetta ζ 从失败中演化出一个接触感知的操作 skill。其 critic 持续监控抓取保持、物体漂移和碰撞风险;触发后,recovery 在保持安全间隙的条件下运输咖啡杯,并在确认稳定放置后结束接管。(SR:86%) 在另一具身基准 Libero-Pro 上,也有同样的现象,以推盘子到炉灶前(Push the plate to the front of the stove)的任务为例。 Round0 :遇到 failure0 “抓住盘子后未保持抓取” 而失败。(SR:0%) Round1 :提出 Critic1 (retained-grasp) 识别 “盘子是否被稳定抓起”,并用 Recovery1 (retained-object transport) 接管搬运,解决 failure0;随后遇到 failure1 “搬运过程中抓取丢失” 而失败。(SR:45%) Round2 :在 Critic1 和 Recovery1 生效的基础上,提出 Critic2 (carry-retention) 识别 “搬运中抓取抖动”,并用 Recovery2 (robust-carry Retry) 稳定抓取、降低搬运风险,解决 failure1,最终成功。(SR:95%) 更关键的是,这些跃升不是靠训练模型、增加参数量或者人为调参实现的。 Zetta ζ 帮助机器人找到了决定成败的关键物理状态变量。 比如:运输前是否确认 “抓取保持稳定”;接触目标时是否建立了 “足够稳定的物理接触”;接近目标前,末端执行器是否处于 VLA
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱