智能AI
morning
让代码接管世界演化,西湖大学发布Code视频世界模型
摘要
该项目的第一作者是南洋理工大学博士生、西湖大学访问学生陈奕文。指导老师是西湖大学通用人工智能实验室负责人张驰助理教授。 能生成一段逼真的画面,不等于能让一个世界持续运转。真正的开放世界不仅要回答「下一帧是什么」,还要记住屏幕之外发生过什么、规则如何作用,以及一次事件会怎样在很久以后继续改变角色与环境。 近年来,视频世界模型的画质、动作控制和交互速度快速提升,它们已经可以把键盘、鼠标、动作或文本指令...
Agent
World
Coding
Code
Model
Proxy
https
buaacyw
github
该项目的第一作者是南洋理工大学博士生
2026-09-04
1 阅读
约10分钟阅读
机器之心
字号:
该项目的第一作者是南洋理工大学博士生、西湖大学访问学生陈奕文。指导老师是西湖大学通用人工智能实验室负责人张驰助理教授。 能生成一段逼真的画面,不等于能让一个世界持续运转。真正的开放世界不仅要回答「下一帧是什么」,还要记住屏幕之外发生过什么、规则如何作用,以及一次事件会怎样在很久以后继续改变角色与环境。 近年来,视频世界模型的画质、动作控制和交互速度快速提升,它们已经可以把键盘、鼠标、动作或文本指令转化为连续视觉画面。但现有系统的核心建模对象,往往仍是「接下来应该生成什么观察」。视觉历史能够记录看得见的结果,却很难直接保存世界规则、角色关系、事件历史和屏幕之外持续发展的因果链。 想象一下,游戏中如果玩家刺杀了一座城市的统治者并离开,城市秩序、继承关系、贸易、阵营联盟以及大量非玩家角色的信念和目标,都应该继续变化。等玩家很久以后返回,系统不仅要生成一幅「看起来合理」的城市画面,还要知道玩家离开期间发生了什么、为什么发生,以及这些后果接下来还会如何延伸。 为此,西湖大学 AGI Lab 的研究团队提出 Code World Model。它不再要求视频模型独自从视觉结果中反推所有隐藏机制,而是把「世界如何演化」和「世界如何被看见」拆成两个互补问题:Coding Agent 负责决定世界如何演化,代码负责让规则持续执行,视频模型负责把演化后的状态转化为高保真视觉观察。 图 1 Code World Model 概览:Coding Agent 维护规则与状态,Proxy 提供时空约束,视频模型负责高保真视觉实现。该图为论文中的 AI 生成示意图。 论文标题:Code World Model: Coding Agent as World Brain 作者:Yiwen Chen、Guosheng Lin、Chi Zhang 论文:arXiv:2608.25927 项目主页:https://buaacyw.github.io/cwm/ GitHub:https://github.com/buaacyw/code-world-model 为什么只学习视频,还不够支撑开放世界 视频记录的是世界演化后的可见结果,却没有直接暴露产生结果的知识、规则和机制。游戏画面尤其如此:每一帧都由固定代码执行后渲染出来,但一旦变成训练视频,真正让世界运转的代码就被丢掉了,模型只能从稀疏的视觉后果中反推碰撞、攻击范围、阵营关系、任务状态等隐藏逻辑。 这种信息缺口在长时间尺度上更加明显。当前视频模型的上下文通常短于一分钟,而角色关系、社会结构和事件后果可能在世界时间里的几天甚至几年中持续演化。许多关键变化又发生在镜头之外。扩大视频训练规模可以增加「见过的结果」,却不会自动提供生成这些结果的白盒机制。 Code World Model 的判断是:开放世界需要两种不同的能力。一种是低频但复杂的推理 —— 理解事件、关联世界知识、规划后果、修改机制;另一种是高频而重复的执行 —— 更新位置、数值、日程、冷却、碰撞和规则。把两者全部塞给同一个视频模型,既低效,也难以保证结果可复现。 核心思路: 代码管「发生什么」 视频模型管「看起来怎样」 图 2 方法流程:交互意图进入 Coding Agent,Agent 通过代码更新 World State;世界状态经条件接口交给视频模型,生成视觉世界并形成反馈闭环。 在这一框架里,Coding Agent 是「世界大脑」。它读取当前世界状态,解释新的交互或事件,决定哪些实体和机制需要改变,并选择调用已有代码还是局部改写世界程序。代码则像 Agent 的可执行延伸,在不需要每一步都再次调用大模型的情况下,持续完成密集、确定、可复用的状态更新。 这意味着代码不是开发者预先写死、之后再也不变的游戏逻辑;它也不是一个与 Agent 分离的外部控制器。Agent 可以根据新情况组合、调用或修改代码,改变的不仅是「当前状态」,还包括这个世界今后如何运行。运行结果、测试和新的世界反馈再返回给 Agent,构成持续的 Agent–Code 闭环。 论文进一步把完整世界状态拆成两部分:可执行状态保存程序、实体属性、规则、关系与事件历史;视觉状态保存由视频模型生成、且需要在时间上保持一致的外观和运动信息。两部分由不同机制更新,但彼此耦合:代码确保规则与后果持续存在,视频模型则利用大规模视觉数据中学到的外观、运动与交互先验,把世界状态实现为高质量观察。 Proxy: 给世界状态增加一条可编程的「视觉通道」 确定了世界状态之后,新的问题随之出现:如何把不断变化的状态准确交给视频模型?只用结构化文本最简单,但文本很难以低延迟方式逐帧描述角色位置、遮挡关系、相机轨迹和实体运动;让 Coding Agent 直接建造完整 3D 世界虽然控制更强,却需要高质量资产、动画、材质、灯光与渲染系统,也会过早限定最终画面。 研究团队因此提出 Proxy:一种由世界状态确定性编译得到的粗粒度视觉条件。Proxy 不追求做出一个低配版成片,而只保留当前观察必须遵守的最小状态,例如实体位置、近似尺度、姿态、运动轨迹、空间关系、遮挡和相机运动。简单的人形、线框车辆、低多边形植被或包围盒,都可以成为可调用的基础组件。 结构化文本与 Proxy 分工明确:文本负责身份、外观、动作语义和风格,Proxy 负责逐帧的空间与时间约束。所有控制信号都能追溯到 Coding Agent 和代码维护的世界状态,因此这条「状态 — 条件」通路仍然是可检查、可寻址、可局部修改的白盒系统。 Proxy 的关键不是越精细越好,而是找到「可构建性」和「约束强度」的平衡。过于丰富的 Proxy 会要求 Coding Agent 同时维护大量关节与细节轨迹;过于稀疏又可能不足以约束视频模型。当前实现把 Proxy 的横纵分辨率都设为目标视频的四分之一,因此视觉 token 数量约为目标视频的十六分之一,额外推理负担相对有限。 数据怎么来: 把游戏运行时与真实视频编译到同一接口 图 3 游戏数据与真实世界数据中的 RGB–Proxy 对齐示例。相邻 RGB 与 Proxy 来自同一时刻,保留实体位置、场景布局、相机运动与遮挡关系。 要让视频模型读懂 Proxy,训练数据必须同时包含严格对齐的 Proxy 视频和 RGB 目标视频。游戏天然适合这项工作:研究团队在运行 GTA V 时同步记录画面,以及构建 Proxy 所需的相机、实体、场景和交互状态。代码可以从同一次运行记录中反复编译不同覆盖范围、不同信息粒度的 Proxy,而不必重新采集 RGB 视频。 这套接口也为真实视频留下了入口。论文在 KITTI-360 上进行了几何辅助的概念验证:校准相机位姿、语义 3D 重建和物体标注只用于离线编译 Proxy,视频模型最终接收的仍是 RGB 目标、Proxy 视频和结构化文本。对模型而言,相机运动和动作后果已经体现在 Proxy 中,不再需要额外定义独立的动作标签。 用约 5.6 小时游戏视频完成原型验证 当前原型在 MiniMax-H3 Ref2VA 视频模型上进行适配。训练数据来自 157 段游戏过程,总计约 5.6 小时;团队以两秒间隔采样出 9,420 个五秒训练片段。每
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱