智能AI
morning
探索RSI,生数新世界模型让机器人开始自我进化
2026-09-15
1 阅读
约9分钟阅读
林, 方舟
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 探索RSI,生数新世界模型让机器人开始自我进化 林, 方舟 2026-09-14 17:36:28 来源: 量子位 林方舟 发自 凹非寺 量子位 | 公众号 QbitAI 机器人学习拧灯泡,如果拧歪了,谁来告诉它问题出在哪,下次又该怎么改? 这正是机器人 “自进化” 让人期待的原因:人类不可能替它示范所有情况,想让机器人越干越好,就需要它有办法评价动作的结果,并从反馈中继续学习。 生数科技最新发布的Motus2,在这方面做了一次不错的尝试,走入了当前具身智能研究中的深水区。 除了“自进化”,它还颇有些集大成的意味: 触觉、灵巧操作、Ego数据……当前具身圈的几个热门关键词,几乎都能在这个世界模型中找到对应。 今年2月,它的前代Motus发布时,世界动作模型的概念甚至还不成熟,而Motus在50项通用任务测试里,较Pi-0.5绝对成功率高出35%以上。 在前代模型基础上,Motus2进一步拓展视觉、语言、动作与触觉等模态,在一个模型里同时点亮三棵技能树:行动、预测、评估。 它既能撸起袖子干活,又能提前脑补“动作之后会发生啥”,还能事后给自己打分。三种能力无缝衔接,形成闭环。 世界模型终于实现自我进化了。 模型实现闭环自进化迭代 我用三个关键词,带你迅速看懂Motus2。 第一个关键词是:自进化 ,这是Motus2相比上一代最核心的变化。 传统的机器人策略模型学习的是:现在看到这个状态,下一步该做什么。 这也是当前行业的主流范式,模型只记住了“看到A就做B”的统计关联,却不理解B为何能导致期望的结果C。一旦环境变了,这种缺乏因果认知的策略便会迅速失效。 而Motus2则把三种能力放在了同一个模型中: 行动:WAM(世界动作模型)生成动作,负责回答“接下来做什么”的问题; 预测:AC-WM(条件动作世界模型)预测后果,负责回答“做完会发生什么”的问题; 评估:VM(价值模型)评估结果,负责回答“这个结果好不好”的问题。 更关键的是,行动、预测、评估这三种能力不再彼此独立,而是开始形成闭环: 生成动作→预测后果→评估结果→更新策略 模型自己预测和评估出的结果,成为改进自身策略的反馈;改进后的策略,又进入下一轮迭代。这也是Motus2对递归自我改进(Recursive Self-Improvement,简称RSI)的一次初步探索。 需要说明的是,这里的“自进化”,指的是利用模型自身的预测和价值反馈持续改进策略,并不意味着机器人已经能在开放环境里无限自主学习。 这是怎么做到的? 想让同一个模型既能“上手干活”又会“预判未来”,就得先解决一个核心问题:绝不能让它在做动作之前,就提前“偷看”到动作执行后的结果。 这是时序上的作弊,一旦发生,即便模型在训练集上看着很聪明,换到真实场景就会立刻露馅。这也是此前许多“视频生成+动作控制”训练方案折戟的原因——模型学会了用未来的视觉帧来“反推”当前动作,而非真正学会决策。 因此,Motus2从机器人领域中间训练阶段,开始采用Action-first(动作优先)的信息流。 这相当于给模型定好了顺序:先根据当前观测生成动作,再预测动作带来的结果,最后评估结果好坏。 当模型明确了信息流的先后关系后,接下来是把预测结果真正变成决策和学习信号。Motus2分别从推理阶段和训练阶段入手。 推理阶段,Motus2用了一种叫Best-of-N规划的办法:模型先想好几个候选动作,分别脑补执行后的画面,再由价值模型打分,挑一个分数最高的去执行。执行完一小段,机器人重新观察真实世界,再开启下一轮。 这相当于给机器人一次比较方案的机会,用于优化当次动作选择。 这种做法在强化学习和规划算法里并不新鲜,Dreamer一类的model-based RL方法早就验证过“先在脑内模拟、再挑最优动作”的思路;Motus2的新意在于把这套逻辑塞进了一个原本只用来生成动作的视频-动作大模型里,而不是单独训一个轻量级的模拟器。 训练阶段,候选动作的打分会被转化成策略更新的信号,分数高的方案得到更强的正向引导,分数低的逐渐被模型放弃。 团队称之为“基于模型的强化学习(MBRL)”。 该阶段只更新动作相关的参数,预测和评估部分保持不动,避免反馈信号把已经学好的模型带偏。 打个比方,推理时规划像是做题时多想几种解法,争取把眼前这道题做对;训练时更新策略,则像是通过练习掌握了更好的解题方法,下次更容易做对。两者都能改善表现,但后者才真正改变了模型学到的东西。 这种机制也改变了具身领域对数据价值的定义,失败数据也有了不同于成功示范的用途。 过去,行业高度依赖“完美轨迹”,失败的轨迹大多被当成噪声过滤掉;但在Motus2的闭环中,成功轨迹告知机器人“正向解法”,而失败轨迹则用于学习动作后果与结果评价,帮助模型识别哪些动作未能推进任务。 让机器人从失败中学习,其他团队也在探索。例如Physical Intelligence的RECAP,会让机器人先跟人学,再自己练习;做错时,人可以接管纠正,模型也会根据执行结果判断哪些动作值得保留、哪些应该少做。 Motus2则进一步利用世界模型,让一些候选做法不必在现实中逐个试过,也能先预测后果、打分比较,再用这些反馈改进策略。 真机实测数据验证了这套闭环的效果。 在手机放置和多指操作两项真机任务中,基础策略平均成功率为65%;单独加入规划,提升至67.5%;单独加入基于模型的强化学习,达到72.5%;两者结合,达到75%,比基础策略高10个百分点。 触觉和记忆补上视觉缺失的信息 第二个关键词是“全模态”。 Motus2新增了两块拼图: 触觉和记忆 。 先说触觉。灵巧操作中,视觉能看到物体在哪、姿态如何,却很难完整判断机器人与物体之间的接触状态。 就拿撕厨房纸来说,两只手的位置看起来正确,也不代表纸已经被稳稳夹住。接触处是否打滑、受力怎样变化,都会影响接下来的动作。 对灵巧操作而言,触觉信息是关键一环,也正是现在市面上触觉技术路线和硬件设备“百花齐放”的原因。 Motus2为此加入了一个轻量级触觉专家模块。 在短动作片段执行之前,它可以读取最新触觉反馈,进一步细化动作。 这里有个务实的设计:触觉专家模块复用了主模型已经算出来的中间结果,不用每次都重新跑一遍完整的视频骨干,兼顾了反馈频率和计算开销。 而这恰恰是不少团队的痛点,接入触觉信号往往意味着额外挂一套独立的小模型,模型越重,反馈就越慢,而灵巧操作最讲究的正是手感,慢一拍动作就可能变形。 在抽取纸杯、撕纸两项真机任务中,加入触觉后,平均成功率从60%提升至72.5%,提升12.5个百分点。 说完触觉,再聊聊记忆,它解决的是另一类问题。 一个方块被藏进三个杯子中的一个,杯子重新摆放之后,只看当前这一帧画面已经判断不出目标在哪,机器人必须记得刚才发生过什么。 Motus2默认缓存近期的真实观测,在寻找隐藏方块、根据历史提示操作按钮这两项测试中,保留完整历史信息的方案平均成功率达到57.5%,明显高于压缩历史
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱