首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

机器人基础模型的「协作时代」来了!芝诺机器人发布全球首个协作具身智能基础模型

2026-09-07 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|冷猫 如何让具身智能持续进化,是整个行业始终关注的核心命题。 最直接的方案,是提升单体能力。更灵巧的双手、更强的泛化能力、更可靠的执行表现 —— 这也是行业长期以来竞争最激烈的方向。 但现实世界中的任务,从来不是专门为一个人,或者一台机器人设计的。一个更聪明的机器人并不能解决所有问题。 于是,另一条思路慢慢变得重要: 为复杂任务添加一些机器人呢? 协作模式天然适合那些物理任务本身需要多个作用点、多个工作空间或者并行操作的场景。 在工厂里,多台通用机器人平时各自工作,充分发挥单体智能;遇到复杂任务时,又能迅速组合能力。系统所需的物理能力,可以随着机器人数量近似线性扩展,而不必每次都重新设计一整套自动化方案。 但如果机器人离开了流水线,脱离了中央调度器的控制,进入更加通用的场景里,它们会各干各的,站在原地大眼瞪小眼?还是更糟 —— 两台机器人都觉得这个杯子该自己拿,最后在桌前「打起来」? 如何让它们真的像两个靠谱同事一样,能 在没有人类指挥或是统一策略的情况下 ,把一件复杂任务自然地拆开、接力、配合完成, 实现 1+1>2 的效果 。 这意味着多机器人系统既要实现众人拾柴火焰高的效果,又要杜绝三个和尚没水喝的问题。 当机器人进入规模化应用时,群体协作一定是其中一种关键的能力,甚至可以说是必须项。 芝诺机器人发布了 Zeno-1,一个 3B 参数的基础模型,是第一个专为去中心化多机器人协作设计的物理智能基础模型,能在本地以 30 Hz 的频率进行闭环视觉 — 运动推理。 简单来说,机器人从现在开始真的可以自主协作完成任务了! 让我们仔细观察这两个机器人协作的细节。 首先是挂裤子的动作。充分表现了两个机器人协作的动作精准性,准确夹取裤子穿过晾衣架,交接晾衣架全程很自然,稳定,没有一点多余的抖动。 给枕头装真空袋,两个机器人的协作水平让人惊掉下巴。这是一个相当长程的复杂任务,也是非常典型的家庭应用场景。机器人稳健地完成了自主动作决策,将具有弹性的枕头装入透明的真空袋,扶好袋子的同时捏紧密封,最后对准位置吸真空。中间任何一环的偏差都无法顺利实现。 更有意思的是,Demo 里的每台机器人运行的其实都是 同一个策略模型的副 本 , 各自通过自己观察到的信息做判断 。谁去抓、谁来配合、什么时候等待、什么时候接手,这些协作行为,是从同一个模型分布自己「涌现」出来的。 技术报告:https://zenobot.ai/research/zeno-1-collaborative-intelligence 这和传统多机器人系统依赖中央控制器统一分工、同步时钟的思路,已经是两条完全不同的路线。 技术拆解:Zeno-1 的四阶段训练 Zeno-1 的核心问题可以用一句话概括: 怎么让一个模型在不被告诉队友想什么的情况下,自己学会跟队友配合? 这个问题之所以难,原因有三。 第一,维度爆炸。 两台机器人各自有自己的观测空间和动作空间,联合状态空间会随着机器人数量上升而快速膨胀,各个智能体之间的交叉注意计算量更是指数级增长。传统多智能体强化学习的做法是在一个中心化的模拟器里同时训练所有 agent,但这种方式在物理机器人上几乎不可行,因为必需的多机器人同步协作数据和特权数据极难获取。 第二,时间累积误差。 两台机器人协作不像下棋那样回合制交替进行,而是连续的、实时的。0.1 秒的时序偏差在当下可能无关紧要,但 5 秒后就可能导致整个任务失败。误差会随时间累积,而且不可逆。 第三,搭档不确定性。 真实场景中,你的搭档可能会犹豫、可能会打滑、可能因为观测噪声做出你意料之外的动作。任何假设「搭档会完美执行预设轨迹」的方法都注定脆弱。模型必须对搭档行为的变化保持鲁棒性。 四阶段递进训练 第一阶段:学习世界(大规模视频预训练)。 第一阶段的目标是让模型建立对物理世界的广泛先验知识。 Zeno-1 在大规模视频数据上进行预训练,学习物理世界的基本规律:物体怎么在力的作用下移动?接触发生时会产生什么?柔性物体在被抓取时如何形变?液体倾倒时如何流动? 这一步完全不涉及机器人控制,模型像一个「旁观者」一样观察大量真实世界的物理交互视频,从中提取运动、接触、形变、因果等通用物理先验。这些先验知识为后续阶段提供了基础:模型不需要从零学习「物体会掉落」或「用力过大会把东西推翻」,这些常识在预训练阶段就已经被编码进去了。 第二阶段:学习自身(单体具身训练)。 视频预训练获得的物理直觉是通用的,还不能直接驱动具体的机器人执行动作。第二阶段将这些通用先验落地到特定的机器人本体上。 在这一阶段,单台机器人在真实环境中进行训练,将预训练得到的视觉 - 物理先验转化为具体的感知 - 决策 - 执行能力。模型学会从自身的视觉观测和本体状态中提取任务相关特征,并将其映射为连贯的全身动作序列。 经过这一阶段,Zeno-1 作为单体已经具备了灵巧操作、工具使用和移动交互等基础能力。 「先成为一个称职的个体,然后才有资格谈协作。」 第三阶段:学习协作(闭环伙伴交互,Closed-loop partner interaction,CPI)。 这是 Zeno-1 最核心的创新。 传统路径是收集大量多机器人协作的演示数据,然后用监督学习去模仿。但这条路几乎走不通:你很难让两个真实机器人在真实环境中大规模生成高质量的协作数据,成本和效率都不允许。 CPI 的思路完全不同。它让两台独立运行的机器人互为训练伙伴。每台机器人根据自己的观测独立行动,而它的动作会改变共享的物理环境,进而影响另一台机器人的下一步决策。 值得一提的是,CPI 训练中,搭档本身就是一个正在学习的自主体,它的行为天然带有各种不完美:有时快、有时慢、有时失误。模型在训练过程中已经见过了大量搭档行为偏差的案例,对延迟也就具备了鲁棒性。 当我们有意扰动协作机器人的动作时序时,Zeno-1 的部署鲁棒性表现得尤为明显。即使面对会让基于同步演示训练的策略迅速失效的延迟,Zeno-1 仍能保持协调协作。 通过 CPI 训练,Zeno-1 学会了一系列具体的协作适应行为: 减速、等待、让步、维持接触、重新校准时序 ,然后在交互重新变得兼容时恢复正常节奏。这些行为完全从闭环交互中自发涌现。 第四阶段:协作失败的针对性纠正 具体做法是:在真实部署中观察机器人的协作过程,识别协作出问题的关键时刻,然后 由操作员围绕这些关键时刻提供纠正性演示 ,这些演示被补充回训练数据中。 关键机制在于最后一步,模型并非均匀地学习所有经验,它会在协作最容易出错的地方投入更多学习资源。 在协作适应过程中提高闭环伙伴交互的比例,其协作性能显著优于添加等量同步多机器人演示数据的效果。 具体而言,训练过程如下: 步骤 1 : 两台机器人被放置在同一个物理环境中,各自加载经过前两阶段训练的策略。 步骤 2 : 两台机器人根据各自的观测独立采取行动。机器人 A 的动作会改变共享物理环境,这个环境变化会进入机器人 B 的下一帧观测,影响 B 的决策,反之亦然。 步骤 3 : 随着交互的进行,两台机器人的时序节奏、运动轨迹和接触力需要持续适应彼此。协作能力从这个闭环中自然涌现。 步骤 4 : 系统会识别协作崩溃的时刻。当配合出现失误,这些失败片段会被标记出来
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱