首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

机器人运动会散场后,自变量给机器人建了一座「虚拟训练场」

2026-08-27 1 阅读 约10分钟阅读 李超凡
分享:
字号:
我已经被机器人刷屏一周了。 机器人刷新了人类百米纪录、「原地起飞」近三米、「害羞跑」的姿势火到海外、赛博张三丰腾空外摆 540°……. 今年的世界人形机器人运动会更热闹了,来自六大洲 16 个国家的 666 支队伍,带着 2056 台机器人来到北京,比赛也从田径、武术等项目,一路延伸到家庭、酒店、工业和应急救援等真实场景。 不过机器人在赛场上的翻车,大家笑笑就过去了。而机器人真正进入家庭后,可能就是打翻水杯、撞倒家具,或者把刚收好的衣服重新扯到地上,那就笑不出来了。 真实的世界里没有固定的跑道和统一摆放的道具,杯子被人挪了一点,桌面多出一块抹布,原本训练好的动作就可能失效。 把机器人这些试错搬进虚拟世界,正是当下世界模型想做的事。它试图还原一个符合物理规律的环境,让机器人真正在动手前先预演:手往左偏一点会不会抓空,夹爪提前闭合会不会碰倒杯子。 但实际上不少世界模型无法实现可靠的「虚拟测试」。它们可能看懂了画面,却没有真正听从动作。推演时间一长,物体和位置开始漂移。虚拟世界里表现更好的策略,到了真机上也未必奏效。 就在机器人开始从竞技场走向真实场景时,自变量机器人发布了自回归世界模型 WALL-SS。 WALL-SS 构建的这座「虚拟训练场」终于突破了世界模型的瓶颈,动作能否真正改变结果,长任务中能否保持连贯,虚拟成绩能否经得起真机检验,都有了新的解法和答案。 它可以推演持续60秒的倒水和物品整理任务,来测试不同动作的结果:按照不同的方式抓水杯,是抓空、碰倒水杯,还是成功抓起? 研究团队还把多套机器人策略分别放进 WALL-SS 和真实世界测试,在虚拟世界里执行效果很好的动作策略,搬到物理世界往往也有好的结果。 这就有意思了,机器人做的「梦」,开始能够用来练习和筛选真实动作。 相关🔗 项目主页: http://x2robot.com/pages/ss 论文链接: https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf Github 链接: https://github.com/X-Square-Robot/wall-ss 机器人「做梦」的方式,会决定现实里是否翻车 世界模型是目前具身智能最受关注的方向之一。 它可以理解成机器人脑中的预演系统。给它当前画面和一组准备执行的动作,它会预测接下来会发生什么。 机械臂向左移动 1 厘米,杯子会被抓住还是被碰倒?抽屉已经打开,下一步应该继续取东西,还是先调整手腕角度?机器人可以比较多个未来,再决定采用哪条动作路径。 机器人公司也可以把不同版本的动作策略放进世界模型测试。表现更好的版本再上真机,省下在真实世界测试动作效果的昂贵成本。 问题是,很多世界模型很多时候更像一位过分乐观的导演。 机器人训练数据通常以成功示范为主。如果模型看到的大部分夹爪闭合动作,后面都跟着物体被拿起,它就容易走捷径:只要夹爪闭合,物体就应该被抓起来。 即使夹爪与物体之间还有明显空隙,生成画面里的物体也可能主动贴进夹爪。论文把这类现象称为类似「磁铁式抓取」的错误。 这类偏差在跑步、跳舞等大动作里未必显眼,到了精细操作中却会直接决定成败。夹爪与杯把差几毫米,机器人可能抓空。插头角度偏了一点,也很难顺利插入接口。 机器人从「会做」走到「做成」,往往就卡在最后几毫米。 世界模型如果直接把这几毫米抹平,给出的未来越流畅,机器人越容易高估一套动作的可靠性。 推演时间一长,还会出现新的麻烦。 世界模型生成完一段画面后,还要把它作为下一段预测的依据。前面一点小误差,会在后续不断累积。物体可能慢慢偏离原位,夹爪与杯子的接触关系也会发生变化。 只保留最近几帧,模型会忘记之前做过什么,但要是保留全部历史,计算量和显存占用又会持续增长。 视频看起来逼真,不代表模型选出的策略真的更好。机器人研发需要知道,虚拟测试里的优胜者,到了真机上能不能继续领先。 世界模型需要让不同动作确实通向不同结果,流畅画面只完成了最表面的一步。 机器人怎么动,未来就该怎么变 WALL-SS 预测接下来几秒的画面时,会先搭出一版「低清预览」。 在这版预览里,模型先确定大方向:机械臂往哪里走,物体大概会怎么移动。随后,它把同一段画面一层层调清,补上物体轮廓、夹爪开合和接触位置。 论文把这种从大轮廓到小细节的层级叫做「尺度」。 已经生成的画面和发生过的动作,会成为下一段预测的历史,这就是「下一尺度自回归」。 画面每清晰一些,动作也会再影响一次未来。 手臂往左还是往右,会先改变低清画面里的运动方向。夹爪何时闭合,会继续影响清晰画面里有没有碰到杯子。 一小段未来生成完成后,它会连同已经发生的动作一起进入记忆,成为模型继续往后推演的依据。 过去一些世界模型更像在开拍前看一眼动作要求,但后面它还是容易依赖任务描述和视觉经验,把剩下的剧情把剧情自己脑补出来。 WALL-SS 把动作和画面放在同一条时间线上。哪只夹爪在什么时候移动到哪里,头部相机和腕部相机应该看到什么变化,都要相互对得上。 同一张初始画面配上不同动作后,模型会生成不同未来。夹爪偏离物体时,它需要表现抓空。路径碰到障碍物时,它也不能直接跳到任务成功的结局。 结果怎么验证呢,WALL-SS 会固定初始画面,只换一条动作轨迹,看未来有没有跟着改变。模型如果只改变画面细节、始终生成同一个成功结局,很难在这项测试中获得高分。 WALL-SS 在这项评测中得到 0.290,Cosmos3 为 0.044,其他模型则是0分。这项指标衡量模型对动作变化的敏感程度。两者之间的差距表明,WALL-SS 更愿意按照输入动作改变后续画面。 模型愿意随着动作改变画面还不够。生成画面里的机械臂,也要真正走在给定路线上。 在衡量这件事的「轨迹精度」上,WALL-SS 得到 0.539,是全部对比模型中的最高分。它的视觉骨干 InfinityStar 得分为 0.251。换成人话,虚拟机械臂既「听见」了动作指令,也更能沿着指令指定的路线移动。 ▲固定初始画面,只改变动作条件,三组分支会生成不同轨迹和不同未来。蓝线是给定动作,橙线是生成画面中实际出现的轨迹. 这些能力也来自一批过去容易被丢掉的数据。 研究团队保留了抓空、滑落、碰撞、重新抓取、人工接管和失败恢复等过程。其中一种采集方式,是先保留机器人发生错误的动作,再回到接近出错前的状态,由操作员执行一套纠正动作。 如果训练数据里没有失败,世界模型很容易把「任务目标」误当成「必然结局」。 做一分钟家务,机器人怎么才能不「断片」 上面说的这些,只能保证机器人没有从第一步开始跑偏。 而家庭任务往往包含多个连续步骤,打开抽屉、拿起物品、放进抽屉、再把抽屉关上,可能持续几十秒。机器人还要记住抽屉是否已经打开,物品目前在桌面还是手里。 WALL-SS 没有让模型把每一帧都永远背下来。它会让记忆随着时间自动变得“模糊”。 刚刚发生的动作保留更多细节:机器人几秒前有没有碰到杯子,夹爪是否已经闭合,都需要精确记住。 更早的历史会被压缩。模型不必一直保存几十秒前每一帧的细节,只要记住桌上有哪些物体、它们大致在哪里、任务已经进行到哪一步。 最初的观察画面会被保留下来,作为场景和物体身份的锚点。视觉历
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱