首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

不再止步于自然语言!PhiZero让世界模型学会「物理语言」

2026-08-18 1 阅读 约10分钟阅读 机器之心
分享:
字号:
从物理视频生成到运动迁移,再到可控世界建模。 如果说自然语言帮助 AI 读取人类记录的知识,那么 PhiZero 所探索的 “物理语言”,则试图让 AI 读懂真实世界中的运动、交互与变化。 论文名称:PhiZero: A World Model Built Around Physical Language 项目网站:https://Phi-Zero.github.io/ 研究团队:Shuyao Shang、Yuqi Wang、Ruopeng Gao、Xu Chen、Tieniu Tan、Lue Fan、Zhaoxiang Zhang 所属机构:中国科学院自动化研究所(NLPR, CASIA) 语言让经验得以保存,也让知识能够跨越时间与个体持续传播。人类借助语言描述日常生活、总结科学规律、书写历史与程序;大语言模型则通过学习这些内容,逐步掌握概念表达、知识组织,以及面向数字信息的理解与推理。 当 AI 开始进入现实环境,仅靠自然语言是否足以支撑它认识世界?进一步说, 除了描述事物的文字,机器能不能学习一套直接表征物理世界细粒度变化的符号系统? PhiZero 从这个问题出发,希望为世界的状态演化建立一种可学习、可预测的新表示。 从结果开始:PhiZero 展示了哪些能力? 1. 生成具有连贯物理过程的视频 无论是海水冲击岩石、液体灌入容器,还是物体坠入热油、金属罐发生爆炸,PhiZero 都可以对后续过程进行建模。它追求的不仅是每一帧足够逼真,也要求动作产生的影响能够延续,整段事件在时间上保持完整。 场景虽然跨越海浪、流体、燃烧与爆炸,模型面对的核心任务却相同:预测当前状态将如何继续发展。 2. Motion Transfer:让同一种变化发生在不同载体上 在物理语言中,重点是变化本身,而非执行变化的具体对象。基于这一特点,一段运动所对应的状态转移可以离开原始视频,被赋予新的外观、身体结构或视觉风格。 Human Body → G1 Humanoid 对于真人运动,PhiZero 可以先抽取其中的状态变化,再让 Unitree G1 人形机器人呈现相应过程。这项迁移不以成对的人类 — 机器人训练视频为前提。 图中包含四组跨身体形态的迁移结果;各组由左侧真人输入与右侧 G1 输出组成。 Human Hand → Sharpa Dexterous Hand 相似的迁移也能发生在手部操作上:人手与物体接触、完成抓握及转动手腕的过程,可以在 Sharpa 灵巧手上重新呈现。 Simulation → Reality 这种机制同样能够连接仿真域与真实域。模型保留仿真片段所包含的动作和交互,再以真实场景的初始外观为基础,生成对应的后续视频。 每行展示同一个交互过程:仿真输入位于左侧,真实视觉域中的重建结果位于右侧。 3. 从单张图像出发,连续探索可交互世界 PhiZero 能够接收持续输入、随时更新的控制信号。每当移动方向或观察视角发生改变,模型都会据此向前生成世界,同时努力维持环境布局、关键地标及空间关系的一致。 四段演示分别从异星地表、月下湖景、滨海村庄和落日原野展开。 4. 由驾驶动作决定未来画面 面对相同的道路起始帧,不同控制轨迹应当导向不同结果。PhiZero 会结合转向的方向与幅度生成相应未来;在下方四个案例中,多条备选控制信号及其生成视频被并列展示。 5. 预测机器人动作带来的视觉后果 在机器人任务中,抓取、舀取和双臂配合等动作轨迹可以先被编码为物理语言,再被还原为细致的交互视频。 视频看起来真实,为什么还不够? 近年来,视频世界模型的生成能力不断提升。输入一幅图像或一条文本指令,模型已经可以合成视觉效果出色的未来片段。但是,画面具有真实感,并不能保证其中发生的事情符合物理规律。 网球碰到玩具鸭之后,后者应当怎样移动?物体坠入滚烫的油中,会引发什么样的液体响应?金属容器爆炸时,火光、碎片和投影又该如何随时间共同改变?要回答这些问题,模型需要超越表面的像素质量,理解 状态之间的转移、动作造成的影响,以及事件向后展开的因果关系 。 传统方法往往直接在维度极高的像素空间里生成未来,物理世界的状态转移也因此被包裹在巨大的视觉预测网络之中。这样的模型擅长合成下一段画面,却缺少一个专门用于表达 “世界接下来怎样变化” 的中间层。PhiZero 正是针对这一缺口提出。 “物理语言” 究竟是什么? 通过在大规模真实视频上进行自监督学习,PhiZero 获得了一组容量紧凑的离散表示,并将其称为 物理语言(Physical Language) 。这套表示不会重复记录颜色、纹理等静态视觉细节,也无意覆盖画面里的全部像素;它专门编码另一类信息: 对象怎样移动、彼此如何作用,以及整个场景从一个时刻过渡到下一个时刻的方式。 以倾倒液体为例,容器的形状与材质已经包含在首帧中;倾斜、流出、扩散等动态过程,则交由物理语言承载。如此一来,描述外观的信息与描述演化的信息被明确分工。 这种分工使状态变化具备复用的可能。即便更换场景、材质或对象形态,原有的运动和交互规律仍可被保存,并进一步参与组合与迁移。 画面中的对象与环境已经改变,贯穿事件的状态转移仍然保持一致。 PhiZero 的方法:推演在前,渲染在后 以物理语言为中间层,PhiZero 构建了 Reason-then-Render(先推理、后渲染) 的世界模型框架。 这套框架由两个主要阶段构成: 阶段一:将视频转写为物理语言。 Physical Language Tokenizer 识别连续世界状态之间的差异,并把这些差异编码成离散符号序列。场景和对象的静态外观由第一帧提供,视觉细节则可以借助预训练扩散解码器恢复,因此,数量有限的符号能够集中记录真正发生的动态变化。 阶段二:在物理语言中预测后续事件。 Physical Language Reasoner 接收当前图像与动作意图,按照自回归方式生成未来的符号序列;扩散解码器随后读取这些符号,将推理出的演化过程转换为视频。 因此,模型对未来的生成可以理解为一条三段式链路: 识别此刻的世界 → 推算后续的状态变化 → 绘制变化对应的视觉结果 物理语言对视频动态进行了高度压缩。一段 4 秒长、8 FPS、分辨率为 512×896 的视频,在首帧之后仅需 256 个离散符号 表示其状态演化;相比之下,标准视频 VAE 会使用 44,800 个连续视觉 token。重建实验表明,即使符号数量大幅减少,模型依然获得领先质量。这说明被压缩表示优先保留了与世界演化相关的信息,而不是反复存储静态外观。 物理语言从哪里来? 与人类语言一样,物理语言也需要从大量经验中形成。 训练数据经历了逐层筛选。研究团队先对约 5 万小时真实世界视频 进行去重、画质过滤和镜头级筛选,从中保留约 1 万小时未标注内容 ,用于训练 Physical Language Tokenizer。接下来,真实视频与仿真视频共同构成约 500 万个时长 4 秒的片段 ,帮助模型覆盖更多状态转移。最终,约 100 万个运动充分、物理事件明确的样本 被进一步选出,用来提升 Physical Language Reasoner 对世界演化的预测能力。 整个学习过程不需要人为规定
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱