智能AI
morning
虚幻引擎CEO围观最新世界模型:代码驱动,视频模型生成画面
摘要
新智元报道 近年来,视频生成模型在清晰度、时序一致性和可控性上快速进步。给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让「可交互视频世界」逐渐从概念走向可观看、可操作的原型。 但会延续画面,并不等于会运行一个世界。镜头中的位移和碰撞只是交互最直观的一层;在更复杂的环境里,角色还有目标、身份与关系,事件受到规则约束,也会留下跨越较长时间的因果后果。许多状态甚至发生在镜头之外,...
coding
video
code
model
agent
proxy
world
state
World
Code
2026-09-08
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 近年来,视频生成模型在清晰度、时序一致性和可控性上快速进步。给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让「可交互视频世界」逐渐从概念走向可观看、可操作的原型。 但会延续画面,并不等于会运行一个世界。镜头中的位移和碰撞只是交互最直观的一层;在更复杂的环境里,角色还有目标、身份与关系,事件受到规则约束,也会留下跨越较长时间的因果后果。许多状态甚至发生在镜头之外,却仍会改变之后的剧情与行动。仅凭局部像素预测下一段观察,很难显式维护这些高层语义。 复杂世界首先需要「理解为什么」。 目标、规则、记忆和因果链条通常无法从当前一帧直接读出,却决定了世界下一步应该怎样变化。语言模型具备的知识调用、推理、规划与编程能力,适合处理这类低频但高复杂度的决策,并将决策进一步落实为可执行规则。 另一个常被忽略的事实是:游戏视频并非世界本身,而是程序执行结果被渲染后的像素投影。 现阶段,游戏与模拟器仍构成视频世界模型最主要的可交互数据来源。若只保留动作与像素,再让视频模型直接学习二者之间的映射,就等于绕过原本存在的程序、规则和显式 world state,转而要求模型从视觉结果中反向拟合整套程序行为。这样的学习路径不仅低效,也把「世界如何推演」和「世界如何呈现」耦合进了同一个模型。 基于这一观察,西湖大学AGI Lab与南洋理工大学的研究团队提出了Code World Model,一种以语言模型为「大脑」的新型世界模型范式。其核心思路是让coding agent通过持续编写、调用和修改code,维护并更新可执行的 world state;与当前观察相关的状态再被转换为proxy,用来指导video model生成精细的视觉画面。 论文链接: https://arxiv.org/abs/2608.25927 项目主页: https://buaacyw.github.io/cwm/ 代码 仓库 : https://github.com/buaacyw/code-world-model 这里的语言模型并不取代视频模型。Code World Model重新划分了两者的职责:知识、目标、规则与长期因果由 coding agent 和 code 负责,外观、运动细节、光照与纹理由 video model 负责。换句话说,前者决定世界中发生什么,后者决定这一切看起来如何。 图 1 Code World Model的核心分工:coding agent通过code演化world state,proxy将相关状态转换为视觉条件,video model生成最终画面。 方法概述 围绕上述分工,Code World Model 将世界的运行过程拆成三个彼此衔接的部分。 coding agent: 理解玩家意图与新事件,调用世界知识,推理潜在后果,并决定需要执行、组合或修改哪些机制。 code: 以更高频率执行位置、属性、碰撞、冷却和事件触发等确定性更新,把高层决策变成可检查、可复用、可持续运行的规则。 video model: 读取演化后的状态条件,利用大规模视觉数据中学到的外观、运动与交互先验,生成带有丰富纹理、光照和局部动态的视觉观察。 这种分工也对应不同的计算频率。coding agent 只需在出现新目标、复杂事件,或现有机制不足时进行稀疏决策;一旦决策被写入 code,程序便可持续执行密集的状态更新。 更重要的是,coding agent 改写的不只是某一时刻的数值,还可以改变世界此后遵循的运行方式。 图 2 Code World Model 总体框架。完整构想包含视觉反馈;当前原型重点验证 coding agent / code → world state → proxy → video model 的前向链路。 proxy连接可执行状态与视频生成 完成职责拆分后,还剩下一个关键的接口问题:coding agent 与 code 维护的是可执行状态,video model 接收的却是文本、图像或视频 token。二者之间需要一种既容易由程序构造,又能够提供逐帧空间约束的共同语言。 结构化文本足够灵活,却很难稳定描述每一帧的实体位置、相对关系、运动轨迹和精确相机变化;完整构建并渲染 3D 世界虽然控制更强,又会重新引入资产、几何、材质、动画和渲染管线的高昂成本。 为此,这项工作引入了 proxy。它从 world state 中提取当前观察真正需要遵循的信息,并将其组织成粗粒度的视觉表示。轻量、确定性的编译器把 proxy 渲染为 proxy video,再与结构化文本一同送入 video model。 文本负责说明「是谁、是什么、要做什么」,proxy 则规定「在哪里、怎样移动、镜头怎样拍」。 proxy 可以表达相机与视角、实体位置和朝向、尺度与轨迹、场景布局和遮挡,以及当前交互所需的粗粒度状态;纹理、材质、精细光照和完整局部运动则有意留给 video model。文章将这一设计原则概括为:只保留当前观察所需的最小充分状态,在控制能力与状态编码成本之间取得平衡。 当前实现中的 proxy 在宽和高上都只有目标视频的四分之一,像素量约为目标的 1/16。它由简单、可复用的几何 primitive 组合而成,不需要 production-quality 资产,却能提供逐帧、可编辑的时空骨架。 从游戏运行时记录中获得严格对齐的数据 要让 video model 学会理解 proxy,训练样本需要同时包含 proxy video、结构化文本与目标 RGB 视频,而且 proxy 与 RGB 必须在时间、相机和实体身份上严格对齐。 游戏的运行时记录天然保留了这种对应关系。研究团队从同一次 gameplay execution 中同步记录 RGB、相机状态、实体身份、位置与朝向、近似尺度、场景布局和交互状态,再通过 code 离线编译 proxy。由于两者来自同一次执行,每一帧都能建立一一对应,跨帧身份也可以稳定映射。 图 3a 游戏数据中的目标 RGB(上)与同帧 proxy(下)。 图 3b 真实视频中的目标 RGB(上),以及利用相机标定、3D 重建和物体标注离线构造的 proxy(下)。 论文使用的 gameplay 数据包含157段录制,总计约5.6小时源视频。研究团队以2秒间隔采样,得到9,420个5秒训练片段;每个RGB目标包含124 帧,分辨率为1344×768、帧率为24FPS,对应的proxy同样包含124帧,分辨率为336×192,并结合 fixed-log depth 与 categorical semantic-ID map。 同一份运行时记录还可以被重新编译成覆盖范围和信息粒度不同的 proxy,无需重新录制RGB。 论文还在KITTI-360上展示了真实视频proxy-observation pair的离线构造流程,以说明这一接口向真实数据扩展的可能性;当前video model的适配仍只使用配对的gameplay数据。 原型系统如何运行? 当前原型采用MiniMax-H3的Ref2VA backbone作为video model,对全部50个transformer b
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱