智能AI
morning
视频DiT直接「长」出 4D 世界!浙大仅用1K条数据打通统一接口
摘要
新智元报道 今天的视频生成模型,已经越来越像一个会拍电影的导演。 一句提示词,它能安排角色、动作和镜头;给它一张图,它能补出后续运动;再加入姿态、轨迹或外观控制,画面甚至可以按照人的意图发生变化。 可一旦离开这台「摄影机」,问题就暴露了。 你看到的仍是一段固定镜头下的二维视频:不能绕到物体背后,不能自由改变观察视角,更不能直接把其中的角色和场景交给游戏引擎、机器人仿真器或VR/AR系统。 视频看起...
https
Beyond
Pixels
Latent
2608
10744
hayd
zju
github
latent
2026-08-20
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 今天的视频生成模型,已经越来越像一个会拍电影的导演。 一句提示词,它能安排角色、动作和镜头;给它一张图,它能补出后续运动;再加入姿态、轨迹或外观控制,画面甚至可以按照人的意图发生变化。 可一旦离开这台「摄影机」,问题就暴露了。 你看到的仍是一段固定镜头下的二维视频:不能绕到物体背后,不能自由改变观察视角,更不能直接把其中的角色和场景交给游戏引擎、机器人仿真器或VR/AR系统。 视频看起来像一个世界,却还不是一个真正可被观察和操作的世界。 那么,视频模型在生成过程中已经学到的外观、运动与空间线索,能不能不经过像素,直接转化为动态三维几何? 来自 ReLER、CCAI、浙江大学 的研究人员给出了一个新的答案: Beyond Pixels——越过像素,直接从视频latent走向4D世界。 论文:https://arxiv.org/abs/2608.10744 项目主页:https://hayd-zju.github.io/Beyond-Pixels/ GitHub:https://github.com/hayd-zju/Beyond-Pixels Hugging Face:https://huggingface.co/papers/2608.10744 文本、图像及其他视频控制条件产生的 latent,可以沿同一条路径转化为可从新视角观察的动态4D场景。 视频到4D 为何偏偏要绕一趟RGB? 利用视频生成先验构建4D内容,最自然的办法是「先生成,再重建」。 视频DiT首先在latent空间中完成去噪,VAE Decoder再把latent解码成RGB视频;随后,另一个独立训练的4D重建模型读取这些像素,恢复相机轨迹与动态几何。 这条路线看似顺理成章,却经历了一次多余的「翻译往返」: 生成latent→RGB视频→重建特征→4D几何 每跨过一次表示边界,都可能损失信息。 更麻烦的是,视频生成器与4D重建器通常见过完全不同的数据。前者面向开放世界内容,后者则多在规模更小、分布更窄的重建数据上训练。 当生成视频出现闪烁、遮挡错误、局部形变或时间伪影时,重建模型还会把这些像素问题进一步「固化」为几何孔洞、破碎表面和不稳定运动。 另一条路线,是直接把某个视频生成模型改造成4D模型,让它原生输出深度、点云或动态高斯。 这样虽然跳过了独立重建器,却往往把4D能力绑死在一个特定生成器上:更换DiT架构、参数规模或条件形式,可能就要重新进行昂贵的几何监督训练。 一边是可组合但容易误差传播,另一边是更直接却难以迁移。 Latent-to-4D想解决的,正是这个两难问题。 传统路线先将latent解码成 RGB ,再用独立模型进行4D重建;Latent-to-4D则通过L4AR直接把最终去噪latent转化为结构化4Dlatent。 不同DiT说着同一种「latent语言」 研究团队注意到,不同的视频DiT未必拥有相同的架构、参数量和条件输入,但它们可能共享同一个VAE。 只要VAE checkpoint、latent归一化、张量布局、压缩规范和latent shape保持一致,这些DiT最终生成的latent就处于同一种表示空间中。 换句话说: DiT可以不同,但只要共用同一套VAE规范,它们在完成去噪后,就可能说着同一种「latent语言」。 而这个最终latent已经包含了上游条件所决定的内容:画面里是什么、主体怎样运动、镜头如何变化,都已经被写进其中。 更重要的是,它位于RGB解码之前。 于是,一个自然但此前没有被充分利用的接口出现了: 把视频模型最终去噪的VAE latent,直接作为显式4D预测的输入。 基于这一思路,团队提出了Latent-to-4D,以及负责连接两种表示空间的核心网络—— Latent-to-4D Alignment and Refinement(L4AR) 。 L4AR 把视频latent翻译成4Dlatent 视频VAE latent不能直接塞进预训练4D解码器。 两者虽然都具有时空结构,但时间分辨率、空间网格与特征维度都不相同。L4AR的任务,就是完成这场跨表示的「同声传译」。 冻结的视频VAE提供输入latent,L4AR负责对齐与时空细化,预训练4D解码层级最终输出相机与动态世界空间点图。 整个过程可以拆成三步。 第一步:先让两个时空网格对上号 L4AR首先通过三线性重采样,把视频latent调整到4D解码层级所需的时空分辨率。 随后,一个可学习的3D卷积同时观察局部空间和相邻帧,将视频latent投影到4D token所需的特征维度。 它做的不只是改shape,还会在最初的对齐阶段聚合局部运动与外观证据。 第二步:一边盯住单帧细节,一边看完整段运动 局部对齐之后,模型还需要推理长距离对应、视角变化与动态结构。 L4AR交替使用两种注意力机制: Frame Attention 在单帧内部整理空间结构; Global Attention 在全部时空token之间交换信息。 前者守住物体轮廓和局部几何,后者把跨帧运动、镜头变化与长距离对应连接起来。 第三步:从4D latent解码出一个动态世界 经过多层细化后,4D Decoder会预测每一帧的相机、深度和世界空间射线,并将它们组合成统一坐标系中的动态点图。 结果不再只属于原始视频的固定镜头。用户可以改变视角,观察场景和物体在时间中的三维变化。 训练不用视频DiT,推理时完成一次「无缝换源」 Latent-to-4D还有一个很有意思的训练设计: 训练阶段根本不需要运行视频DiT。 团队先用冻结的Wan VAE编码已有的重建视频,得到observed-video latent;然后利用这些视频已有的相机与几何标注,训练latent到4D的下游路径。 整个过程中,视频生成器、VAE和预训练4D模型的原始Transformer权重全部保持冻结。主要更新的是: latent对齐模块; 基于LoRA的轻量时空细化参数; 相机与几何预测头。 到了推理阶段,只需要进行一次替换: 把真实视频编码得到的latent,换成兼容视频DiT生成的最终去噪latent。 后面的L4AR和4D Decoder完全不变,也不进行测试时适配。 为什么文本、图像、姿态和轨迹可以共用同一条路径? 因为这些条件已经被视频模型「实现」在最终latent中。对于L4AR来说,它不需要额外知道上游执行的究竟是哪一种任务。 一个checkpoint横跨三种DiT 4D几何监督一向稀缺,但这项工作并没有重新采集一套巨型数据。 Latent-to-4D的最终训练阶段只使用了约 1K条已有重建视频 。在此基础上,同一个checkpoint被原样接入: Wan2.1-T2V-14B; Wan2.1-T2V-1.3B; Wan2.2-I2V-A14B。 它们覆盖不同参数规模的Text-to-Video模型和Image-to-Video模型,但共享同一套Wan VAE。 切换DiT后,不重新训练,不为条件任务增加分支,也不做测试时微调。 视频模型负责「想象内容和运动」,Latent-to-4D则提供一个统一的4D出口。 同一个latent,直接预测比「先解码RGB再重建」
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱