首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Code-as-World:从一段视频,逆推整个物理世界

2026-08-28 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 像素告诉我们世界如何呈现,物理代码解释世界为何如此运行。 生成一个世界,不等于理解一个世界。 今天的 AI 已经可以生成逼真的视频,也可以用代码搭建复杂的 3D 场景。但无论是像素还是场景,都只是世界的 “表象”。真正的物理智能,需要进一步回答:这个世界由什么构成、处于什么状态、又遵循什么规律? 换句话说,AI 的下一步,不只是预测世界会 “看起来怎样”,而是恢复为什么世界会这样运行 —— 从描述现象,走向发现机制。 近日,MirroS 提出 Code-as-World:让 AI 将观测到的现实主动重建为可执行、可验证、可推理的代码世界,并以此作为理解物理世界的表征。在这套框架下,对象、状态、物理参数与演化规律被显式写入代码,一个关于世界的解释由此不再只是语言描述或隐式特征,而成为一个可以查询、执行、干预和验证的 世界假设 。 如果说从观测直接预测未来,回答的是:接下来会看到什么? 那么 Code-as-World 进一步追问:什么样的世界,能够产生这些观测,并在干预之后继续演化? Code-as-World 将物理组成、动态演化与视觉外观显式写入可执行代码,并让智能体围绕观测不断提出、运行、检验和修正世界假设。这些经过验证的可执行世界可以转化为可规模化的物理监督,推动视觉语言模型学习物理推理。 项目主页:https://mirros-lab.github.io/code-as-world 论文: https://mirros.ai/report/code-as-world.pdf 代码:https://github.com/mirros-lab/code-as-world 全文 Blog : https://mirros.ai/blog/representing-physical-world 01|生成得像,不等于理解得对 人类理解物理世界,并不是记住每一次具体观测。 面对不同大小的球、不同角度的斜坡和不同材质的地面,人类仍然会使用物体、质量、速度、重力、摩擦等概念进行思考。真正能够迁移的知识,存在于这些紧凑的抽象之中,而不是某一段视频的全部像素。 这也意味着, 复现观测,并不等于形成了对世界的理解 。只要生成出的未来在视觉上足够合理,像素预测本身并不要求模型显式回答:世界中存在什么、状态如何变化,又是什么机制支配着这些变化。 问题因此进一步落到: 什么样的表征,才能真正支撑对物理世界的理解与推理? 现有的几类世界表征,各自保留了世界的一部分信息。 像素保留丰富细节,却把原因隐藏在结果之中;3D 重建恢复几何、深度和视角,却不自动解释物体为何下落、碰撞或停止;自然语言能够紧凑地表达实体、动作和关系,却难以精确承载连续轨迹、接触关系与物理参数。 Code-as-World 希望找到一个新的结合点: 像语言一样具有语义,像 3D 一样具有结构,又像视频一样能够表达连续演化。 代码恰好提供了这样一种形式。对象、状态、参数与规则可以被显式写出;世界不仅能够被描述,还能够被执行、干预和检验。Code-as-World 因而不追求每一个像素的完全复制,而是优先保持世界组成、约束与演化机制的一致。 真正重要的,不再只是把世界复现得更像,而是找到一种能够显式承载世界结构与机制的表征。 02|不是更真实的像素,而是一套可执行世界 如果要用代码来抽象一个物理世界,究竟需要写下什么? Code-as-World 将一个世界拆解为三个相互关联的方面: Composition: 世界中有什么 ,描述物体、几何结构与质量、摩擦、重力等基本物理属性。 Evolution: 世界如何变化 ,描述物体的状态、运动、交互与关键事件,以及世界随时间的演化过程。 Appearance: 世界如何被观测 ,描述相机、背景、材质、光照等视觉呈现条件。 三者结合起来,Code-as-World 表达的就不再是一张场景图,也不只是一段轨迹,而是一个可以真正运行起来的世界。 不同组件还可以被独立查看和修改:改变一个物体的速度、质量、运动方向或相机位置,其他结构仍然可以保持不变,世界随后重新执行。这也让 “世界编辑” 从像素层面的重新生成,变成了对底层机制的直接干预。 代码在这里不是最终答案。 它更像一个能够被运行和证伪的 世界假设 。 03|让 Agent 在模拟与验证中发现世界 从一段视频或文字中恢复底层物理世界,本质上是一个复杂的逆问题。 因此,Code-as-World 没有把世界表征视为一次性的代码生成任务,而是将其构造为一个 agentic discovery loop :让 Agent 在不断提出假设、模拟与验证的过程中,逐步逼近能够解释观测的世界。 这一过程借鉴了科学发现中的溯因推理:从不完整、带噪声的证据出发,不断寻找能够最好解释观测、同时保持简洁的机制假设。 首先,不同形式的输入会被转换为相应的证据。 对于文本,系统提取实体、空间关系、物理事件和预期结果;对于真实视频,则进一步提取深度、实例分割、物体轨迹与三维几何,共同约束可执行世界表征。 随后,Agent 进入五个连续阶段: Propose|提出世界假设:根据当前证据和反馈,生成或修改世界表征。 Instantiate|实例化:将抽象世界假设编译为可执行程序。 Execute|执行:运行模拟,得到完整的世界状态轨迹。 Render|渲染:把状态轨迹转换成可观测视频 Verify|验证:把模拟结果与输入证据逐项比较,将差异整理成反馈。 于是,世界表征不再依赖 “一次猜中”,而成为一个持续循环: 提出 → 实例化 → 执行 → 渲染 → 验证 → 修正。 每一轮执行都让世界假设产生可观测的后果;每一处差异都在告诉 Agent,究竟是世界组成、动力学过程,还是相机与外观设置出现了问题,把上一轮暴露的问题,转化为下一轮有方向的修改。 它不是重复抽样,而是在利用错误。 04|世界一旦可执行,物理监督就能规模化 让世界变得可执行,价值并不止于更可控的模拟和生成。 它还解决了物理智能训练中一个长期存在的问题: 真实视频很多,但隐藏在视频背后的物理标签极少。 互联网中存在海量运动、碰撞与交互视频,但它们通常不会告诉模型:物体的真实尺寸是多少,某一时刻速度是多少,运动过程中的加速度如何变化,更不会提供完整的三维状态轨迹和接触事件。 可执行世界则天然拥有这些信息: 一段可观察的视频; 一条精确的模拟状态轨迹; 物体尺寸、相机参数与时间戳; 位移、速度、加速度等世界尺度标签。 Code-as-World 从原始视觉观测出发,恢复其背后的结构化世界,使原本隐藏在像素中的状态与动力学变成可直接使用的训练监督。 基于这些可执行世界,MirroS 训练了 Code-as-World-VL 系列模型。 在李飞飞提出的首个 VLM 物理推理量化评估基准 QuantiPhy 上: Code-as-World-VL-9B 模型超过 Gemini-3.1 Flash 的 54.8; Code-as-World-VL-27B Reasoning 模型进一步提升至 58.6。 这意味着,可执行世界不仅是一种外部模拟工具,也可以成为一种新的训练数据形态: 把无法直接标注的物理机制,转化为能够规模
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱