智能AI
morning
π0引用的中国团队,又出手了:世界仿真器新作发布
摘要
π0引用的中国团队,又出手了:世界仿真器新作发布 思邈 2026-08-18 17:57:40 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 机器人撬开啤酒瓶盖,白色泡沫顺着瓶口涌出来。 紧接着,它倾斜酒瓶,酒液划过画面右下角,被稳稳注入杯中。 一整套动作行云流水,乍看和真机实拍没有任何区别,平平无奇。 但真相是——从瓶盖弹开的瞬间、泡沫与酒液的流体变化,到后续的所有物理反...
CurrentWorld
量子位
Current
dWorldEval
评测机器人
π0引用的中国团队
又出手了
世界仿真器新作发布
2026
凹非寺
2026-08-18
1 阅读
约9分钟阅读
思邈
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> π0引用的中国团队,又出手了:世界仿真器新作发布 思邈 2026-08-18 17:57:40 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 机器人撬开啤酒瓶盖,白色泡沫顺着瓶口涌出来。 紧接着,它倾斜酒瓶,酒液划过画面右下角,被稳稳注入杯中。 一整套动作行云流水,乍看和真机实拍没有任何区别,平平无奇。 但真相是——从瓶盖弹开的瞬间、泡沫与酒液的流体变化,到后续的所有物理反馈,整段画面全是由 AI实时推演生成 的! 这就是 Current Robotics团队 刚刚交出的硬核新作: CurrentWorld-0 ,一套交互式世界仿真器(Interactive World Simulator)。 它首次把 跨本体、多视角、力-触觉预测 塞进同一个系统,也是该团队继人形全身精细操作模型Curr-0之后的又一次出手。 而这家低调团队的技术底色与操盘手,同样来头不小—— 创始人 祝毅晨 曾任美的集团具身智能部部长,已发表40余篇顶会论文,学术引用超过5,200次。 作为国内最早发布VLA及世界模型的研究者,他曾带领团队提出扩散模型和VLM端到端的VLA范式(TinyVLA),拓展VLA+CoT策略(DiffusionVLA & DexVLA,发表至ICML和CoRL),并较早提出世界模型用于具身策略评估(dWorldEval,发表至ICML高亮论文)。 值得一提的是,Physical Intelligence在其里程碑论文π0中,就 引用了祝毅晨团队完成的TinyVLA与ScaleDP工作。 △图源:π0论文References 从早期的VLA大模型、人类示教数据,逐步延伸至全身机器人学习,这些前沿探索最终沉淀为Current Robotics的技术基石。 而对于刚刚亮相的这套交互式世界仿真器,团队的核心目标很明确: 机器人的身体和观察方式可以千差万别,但在走进真实世界前,它们演练的必须是 同一个世界 。 评测机器人,首先需要一个不会替策略纠错的世界 机器人世界模型有一个很自然的起点:视频生成模型。 经过大规模预训练之后,模型已经记住了不少视觉和运动规律:物体被遮挡后不会凭空消失,形状不会突然改变,运动在时间上也通常是连续的。 一次常见的抓取会怎么发生,模型其实已经“看过”很多遍,这对视频生成当然是好事。 但机器人训练数据里大量的成功范例,让模型见惯了“伸手—抓住—拿起”这样的轨迹。当一个还没训练好的策略把手伸偏,视频先验有时反而会把后面的结果继续往“成功”上补。 机械臂实际没有抓稳,生成画面里的物体却还是跟着手走了。真实执行已经失败,世界模型给出的未来却仍然顺利完成了任务。 放到机器人评测里,这样的“纠错”会直接让结果失真。 Current Robotics此前在 dWorldEval 中研究的,正是世界模型的 动作可控性(action controllability) :动作发生变化,后面的世界也必须跟着变。 机器人往左偏了一点,物体不能还沿着原来的轨迹走;动作已经失败,模型也不能替它把后面的结果补回成功。 对于CurrentWorld来说,这是一条最基本的要求: 机器人怎么做,世界就怎么变化;即使做错了,模型也不能替它把结果纠正回来。 CurrentWorld-0:评测机器人,为什么需要跨本体、多视角和力-触觉? 假设现在要评测一个最简单的动作:让机器人把桌上的杯子往前推一点。 如果执行者是一台固定双臂机器人,动作可能只涉及机械臂;换成移动升降双臂,底盘和升降机构也可能参与进来;再换成人形机器人,整个动作又会落到另一套全身控制上。 同样一句“把杯子往前推”,到了不同机器人身上,真正输入给模型的动作已经完全不同。 CurrentWorld-0因此没有先规定一种所有机器人都必须使用的动作格式,而是保留不同本体自己的 Action Subspace 。 模型需要做的,是把这些不同形式的动作继续往后推演:杯子受到了什么影响,位置发生了多少变化,后面的场景又该怎么接下去。 这也是跨本体建模真正困难的地方。 机器人可以换,动作接口可以换,但杯子不会因为执行者换了,就突然变得更轻、更重,或者开始遵循另一套运动规律。 可仅仅知道杯子动了,还不足以完成一次动作。 机器人执行任务时,往往同时依赖多个摄像头。 第三视角看到整个桌面,头部相机随着机器人运动,腕部相机几乎贴在机械手旁边。一个动作发生以后,杯子会同时出现在几路完全不同的画面里。 这时候,问题就从“这一帧生成得像不像”变成了“几路画面能不能对得上”。 比如第三视角已经看到杯子向前移动了十几厘米,腕部相机里的杯子却还停在原处;又或者物体被机械臂挡住几秒,再出现时位置突然发生跳变。 任何一路出现这种漂移情况,这次评测的物理过程都会断开。 CurrentWorld-0要维持的,是 多个相机对同一次事件的共同记录 。 当前Demo中,模型可以同步生成多路视角,并让机器人、物体和场景状态随着操作持续向前变化。 如果把任务从“推杯子”换成夹薯片或者削黄瓜,复杂度又增加一层。 机器人已经把夹爪放到盘中,视觉上看起来位置完全正确,可它究竟有没有捏住薯片,仅靠画面并不好判断。 削皮刀也是如此。刀刃已经贴住黄瓜,并不意味着这一刀真的削下去了。受力太轻,可能只是从表面划过;接触不稳,也可能下一秒就发生滑移。 CurrentWorld-0因而把 力觉和触觉 也放进未来预测里。 工具什么时候真正受力,接触有没有实际发生,抓取是否稳定,这些原本藏在像素之外的状态,也会随着机器人的动作一起变化。 如此,一次完整的机器人评测需要锚定的,其实是一整段连续过程: 机器人按照自己的方式发出动作,物体随之变化; 多个摄像头从不同位置记录这个结果; 真正发生接触以后,力和触觉再补上画面里难以直接看到的部分。 CurrentWorld-0把跨本体、多视角和力-触觉统一放进模型,最终要还原的,是一次动作从输入开始,到环境响应、接触发生,再到物理反馈出现的完整过程。 人类接管:在世界模型里重新选择下一步 真机执行任务时,一个中间状态往往很难被原样复现。 动作继续往前,物体位置、机器人姿态和接触关系都会随之变化;如果想从同一个位置重新尝试,通常需要重新复位场景,再把前面的过程跑一遍,费时费力。 而在 CurrentWorld-0 里,这个过程可以被中止。 策略自主执行后,当机器人进入潜在失败状态,操作员可以通过遥操作直接接管,从当前位置继续完成后续动作。 当前状态也可以被保存和回滚,一次尝试结束后,再回到同一个节点,换一种方式继续推进。 于是,同一个状态之后,可以接上不同的动作,也会得到不同的结果。 这延续了Current Robotics团队此前 Hi-WM(Human-in-the-World-Model) 工作的思路。 到了CurrentWorld-0,每一次接管都会把后续交互重新展开:画面会继续变化、新的接触带来对应的力与触觉反馈、操作员的纠正
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱