智能AI
morning
用3D几何先验驱动视频扩散,实现更一致的世界生成
2026-08-19
1 阅读
约10分钟阅读
机器之心
字号:
随着视频扩散模型能力不断提升,从单张图像出发、按照用户指定的相机轨迹生成新视角视频,正在成为 World Modeling 的重要技术路线。 Camera-Controlled Video Diffusion Models 已经能够利用相机参数或几何条件控制视角变化,并生成具有较高视觉质量的视频。然而,这类方法大多依赖隐式的时空表示,缺少显式的 3D geometric grounding。尤其在较大的视角变化下,模型容易出现不合理的几何结构、物体形变以及跨视角空间不一致等问题。 针对这一问题,智象未来 (HiDream.ai) 提出 DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling,并被 ECCV 2026 录用。 DreamWorld 的核心思路是:将 3D Foundation Model 的空间结构先验与 Video Diffusion Model 的高质量生成能力结合起来,并显式地把 Geometry 作为世界生成过程中的中间结构表示。 不同于直接在 RGB 空间中完成所有生成任务,DreamWorld 采用 Geometry-then-Appearance 的两阶段框架: 先生成目 标 视角对应的几何结构特征,再以这些特征为条件生成最终 RGB 视频。 图 1: DreamWorld 与现有 Camera-Controlled Video Diffusion Models 的概念对比。与缺少显式 3D geometric grounding 的方法不同,DreamWorld 将 geometry 作为中间结构表示,引入 3D Foundation Model 的空间结构先验,以提升跨视角一致性与几何稳定性。 论文标题:DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling 论文主页: https://yanghb22-fdu.github.io/DreamWorld 论文链接: https://yanghb22-fdu.github.io/DreamWorld/asserts/DreamWorld.pdf 本文核心亮点 几何驱动 :将 3D Foundation Model 的空间结构先验引入 Video Diffusion,为 Camera-Controlled World Generation 提供显式的 3D geometric grounding。 结构中间态 :将 Geometry 从视频生成中的隐式结果提升为显式的 intermediate structural pivot,先生成目标视角的几何结构表示,再指导最终视频合成。 生成解耦 :采用 Geometry-then-Appearance 两阶段框架,将 3D 结构推理与高质量外观生成分开建模,兼顾几何一致性与视觉质量。 效果领先 :DreamWorld 在 RealEstate10K、Tanks-and-Temples 和 WorldScore 等基准上取得领先表现。 01 Camera-Controlled Video Generation, 还缺什么? 近年来,视频扩散模型不断扩展生成模型的能力边界。在 Camera-Controlled Video Generation 中,用户可以给定一张初始场景图像,并指定一条相机轨迹,模型再根据相机运动生成对应的新视角视频。这类方法使视频生成模型逐渐具备了 “探索场景” 的能力,也成为 World Modeling 的重要技术路线之一。但问题在于:生成的视频看起来真实,并不意味着背后的 3D 空间一定稳定。 现有方法通常利用相机参数、Plücker embedding,或者由单张图像重建得到的点云投影视图作为生成条件。这些方法已经可以实现较好的 camera control,但视频扩散模型本身仍然主要依赖隐式的时空表征来推断未观测区域的场景结构。 在较大的 viewpoint change 下,这种缺乏显式 3D grounding 的建模方式可能带来: geometrically implausible structures; distorted object shapes; cross-view spatial inconsistencies。 也就是说,在相机不断移动的过程中,模型不仅需要生成新的图像内容,还要持续推断原本不可见的三维结构。而这正是当前 Camera-Controlled VDM 面临的重要挑战。 02 从视频生成, 到 Geometry-Grounded Video Diffusion DreamWorld 的出发点,是重新思考 Geometry 在 Video Diffusion 中扮演的角色。 在很多已有方法中,Geometry 更像是一个辅助信息:相机参数可以告诉模型 “相机怎么移动”,几何投影可以提供目标视角下的部分可见内容,但最终的结构补全与视觉生成仍然需要由同一个视频模型共同完成。 DreamWorld 则选择了一条不同的路径:不再把 Geometry 只作为辅助条件,而是将其显式建模为生成过程中的 intermediate structural pivot。 换句话说,DreamWorld 不直接从输入图像一步生成最终目标视频,而是将生成过程拆分为两个连续阶段:给定 Input Image 和 Camera Trajectory,模型首先进行 Geometry Generation,生成目标视角对应的结构表示;随后,Appearance Generation 以这些 geometry features 为条件,进一步合成最终的 RGB Video。 第一阶段负责生成目标视角对应的结构表示。第二阶段再基于这些结构表示完成最终的视觉合成。这样,Geometry 不再只是 RGB 生成的隐式副产品,而成为连接 3D 空间结构和高质量视频生成的中间桥梁。 图 2: 直接以 warped partial images 作为条件时,生成结果容易受到结构缺失和投影 artifact 的影响;DreamWorld 则先在 geometry feature space 中完成结构推理,再进行 appearance synthesis,从而获得更加稳定的跨视角结果。 03 用 3D Foundation Model 提供结构先验 如果要显式建模 Geometry,一个自然的问题是:什么样的表示适合作为视频生成中的几何结构? DreamWorld 选择预训练 3D Foundation Model 的中间特征作为 geometry representation。相比直接在 RGB pixel space 中进行结构推理,这类特征由大规模 3D /multi-view 数据预训练得到,能够编码与场景空间结构相关的 geometry-aware information。 具体而言,DreamWorld 从 3D Foundation Model
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱