首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

把「因果思维链」焊进世界模型,它凭什么登顶?

摘要

编辑|张倩 把一个杯子从桌子左边推到右边,对人来说再自然不过。但如果把这个过程拆开,会发现所谓的「未来」其实并不是凭空出现的:手臂先移动,接触发生后杯子才开始滑动,运动又改变物体的位置和空间关系,最终才形成下一刻我们看到的画面。 对于世界模型来说,问题也在这里。 现在不少模型已经很擅长直接从「当前画面」生成「未来画面」。但如果中间这些运动、接触、几何变化全部藏在模型内部,我们很难知道,它究竟理解了...

CausalWM https Aether RSIAgent Causal Chain Thought github Depth Pointmap
2026-09-21 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|张倩 把一个杯子从桌子左边推到右边,对人来说再自然不过。但如果把这个过程拆开,会发现所谓的「未来」其实并不是凭空出现的:手臂先移动,接触发生后杯子才开始滑动,运动又改变物体的位置和空间关系,最终才形成下一刻我们看到的画面。 对于世界模型来说,问题也在这里。 现在不少模型已经很擅长直接从「当前画面」生成「未来画面」。但如果中间这些运动、接触、几何变化全部藏在模型内部,我们很难知道,它究竟理解了世界如何变化,还是仅仅根据训练数据,「猜」出了一个看起来合理的未来。 最近, Aether AI 正式发布了第一版因果世界模型 CausalWM (16B 参数)。它尝试把原本藏在模型内部的这段过程显式写出来,并引入了一种新的技术范式 —— Causal Chain-of-Thought,因果思维链 。 来源: Aether AI 创始人黄碧薇 X 官方账号 简单来说,CausalWM 不急着直接生成未来,而是先推演物体如何运动、三维几何关系怎样变化,再根据这些中间结果继续生成未来画面。 Aether AI 希望借此回答一个更难的问题: 世界模型能不能不只预测「未来长什么样」,还进一步理解「未来是怎样一步一步发生的?」 这套方法目前也已经得到了一些阶段性的实验验证。 在最新更新的机器人世界模型基准 TriWorldBench 上,CausalWM 登顶 Leaderboard,取得 Top-1。这个榜单专门考察世界模型对机器人任务的预测能力,尤其是头部相机、左腕相机、右腕相机的三视角一致性。该榜单总共包含六个评测维度、19 项具体指标,只是「看起来合理」很难拿高分,需要理解机制才行。 这条思路与团队此前发布的 RSIAgent 一脉相承。RSIAgent 让智能体进入陌生软件,通过主动探索和反复验证,摸清操作与结果之间的关系,再把经验沉淀进 Memory。它没有更新模型参数,却推动 Kimi-K3、GLM-5.3 等开源模型在 OSWorld 2.0、Agents’ Last Exam 上超过 GPT-6 Astra 等闭源模型。RSIAgent 处理的是数字环境,CausalWM 将问题推进到了机器人所在的物理世界。 相比「又一个榜单第一」,更值得讨论的是: CausalWM 为什么要在世界模型里加入这样一条因果思维链,以及这条链究竟是怎样工作的? 论文标题:CausalWM: Causal Chain-of-Thought Reasoning for Embodied World Model 代码链接:https://github.com/AetherLabsAI/CausalWM 模型权重:https://huggingface.co/AetherLabs-AI/CausalWM 项目主页:https://aetherlabsai.github.io/CausalWM/ 论文链接:https://openreview.net/pdf?id=3pf4d0EEqm 世界模型也开始写「解题过程」 目前不少世界模型采用一条很直接的路径:输入当前画面和动作指令,生成未来视频。这种方法在数据规模足够大时很有效。模型见过大量「手推杯子」的视频,自然能猜出杯子接下来大概率会移动。 但运动、接触和空间变化都被压进了模型内部,我们很难判断它究竟理解了物理过程,还是从训练数据中找到某种 shortcut。 场景一复杂,问题也容易暴露出来。机器人连续操作多个物体,预测时间拉长,中间一次接触判断失误,后面的画面就可能越偏越远。 CausalWM 的思路,有点像让一个只写答案的学生补上解题过程。它并不直接从当前画面跳到未来画面,而是在生成未来视频前,先把其中一部分物理变化显式地预测出来。 团队选取了几类可以从视频中自动提取的物理变量: Optic al Fl ow ,也就是光流,描述画面中的物体往哪里移动、移动了多少。 Depth ,描述物体与相机之间的距离。 Pointmap ,则进一步为画面中的像素补上三维空间位置,让模型获得更明确的三维几何关系。 但真正关键的,并不是 CausalWM 使用了 Flow、Depth 或 Pointmap。这些变量过去已经被大量用于视频预测和视觉理解,有时也会作为辅助监督信号出现。CausalWM 真正不同的地方,是 把它们组织成一条有顺序的 reasoning chain 。 还是以推杯子为例。模型并非先回答: 几帧之后,杯子会在哪里 ?而是先思考: 画面中什么东西正在运动,它正在往哪里运动? 这对应的是 Physical Motion 。CausalWM 可以通过 Optical Flow 表达这一步变化。 接下来,模型继续推演: 这样的运动,会让场景中的三维空间关系发生什么改变? 杯子的位置发生了变化,机械臂与杯子的相对距离发生变化,整个场景的三维结构也跟着变化。这一步对应 Geometry ,可以通过 Depth、Pointmap 等变量表达。 到这一步之后,模型才真正去生成: 在这样的运动与几何变化之后,未来画面应该是什么样子? 于是,一条典型的推理链形成: Observation → Physical Motion → Geometry → Future Observation 这里还有一个很重要的区别。传统方法即使预测 Flow、Depth 或 Pointmap,也可能只是把它们当作训练阶段的辅助目标。模型做完这道「辅助题」,未来视频仍然可以走另一条内部路径生成。 CausalWM 则不一样。模型预测出 Flow 后,会 把这一步结果重新放进上下文 ,继续用来判断三维几何关系;随后得到的 Pointmap 又进一步进入上下文,参与未来画面的生成。因此 每一步既是预测目标,也是下一步推理的条件 。这也是为什么团队把它称作 Causal Chain-of-Thought 。它利用现实世界本身就存在的运动与几何变化,搭出一条真正参与未来生成的 reasoning trajectory。 为了避免模型训练时「偷看答案」,CausalWM 还加入了 stage-ordered attention mask 。简单理解,就是给不同推理阶段规定阅读权限:前面的步骤只能看到已经发生的信息,不能提前读取后面的 Pointmap 或未来画面。否则,模型虽然表面上完成了 Motion、Geometry 等中间预测,实际上可能已经从「最终答案」中反推出前面的变量,这条所谓的因果链也就失去了意义。 因此,无论训练还是实际推理,模型都必须按照同样的方向往下走: Motion → Geometry → Future。 3 万小时视频, 分三步把因果链训出来 要让模型真正沿着这条链推演,光有架构设计还不够。Aether AI 为 CausalWM 构建了约 3 万小时的具身视频混合数据,覆盖机器人操作、第一视角视频、多视角机器人数据,以及其他物理交互场景。 整个训练过程分为三步: Pixel-level Pre-training → Causal CoT Mid-training → Multi-objective RL Post-training 第一阶段:先建立足够强的世界生成能力 Causa
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱