首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

摘要

近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文《 V-RAE: Rethinking Vi deo Latent Spaces for Generation 》中提出视频表征自编码器 V-RAE 。该方法以冻结的视觉基础模型为编码器,通过轻量级时间池化压缩视频特征,并将具有丰富语义和时间连续性的表征直接用于视频重建、生成与未来预测。 当...

latent RAE representation VAE space Representation based Autoencoder Video temporal
2026-08-26 1 阅读 约10分钟阅读 机器之心
分享:
字号:
近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文《 V-RAE: Rethinking Vi deo Latent Spaces for Generation 》中提出视频表征自编码器 V-RAE 。该方法以冻结的视觉基础模型为编码器,通过轻量级时间池化压缩视频特征,并将具有丰富语义和时间连续性的表征直接用于视频重建、生成与未来预测。 当视频生成模型不断变大、数据和算力持续增长时,人们往往关注更强的生成骨干和更长的训练,却容易忽视一个更基础的问题:生成模型究竟在什么样的空间里学习? 主流视频生成系统通常先用 VAE 把原始视频压缩为潜在表示(latent),再由扩散或自回归模型学习这些表示的分布。这个 latent space 就像视频生成的“隐形地基”:它决定模型需要学习什么,也影响训练难度、收敛速度和最终质量。传统视频 VAE 大多以像素重建为核心,擅长保留纹理、色彩和局部细节;然而,“能够准确还原真实视频”,并不等于“容易生成全新视频”。 近期,Representation Autoencoder(RAE)在图像生成中的探索开始重新思考这一“地基”应该如何构建。 与传统 VAE 从像素重建目标中学习 latent 不同,RAE 直接利用预训练视觉模型已经学到的高层 representation 作为生成空间,让生成模型从一个具有更丰富语义结构的 latent space 出发。 这也自然带来了一个新的问题: 这一思路能否从图像进一步扩展到视频?预训练视觉 representation 是否也能成为有效的视频生成 latent? 视频相比图像又带来了新的挑战:除了空间语义,还需要 建模动作 、 时间动态 和 跨帧依赖 ,同时逐帧视觉 representation 中存在大量时间冗余。因此,我们在 V-RAE(Video Representation Autoencoder) 中系统验证了 representation-based latent 在视频上的可行性,并进一步研究了 什么样的 latent space 才真正适合视频生成 。 将 RAE 从 Image 扩展到 Video V-RAE 以冻结的视觉基础模型作为编码器,系统研究了 DINOv3、SigLIP2、EUPE 和 V-JEPA 2.1 四种具有不同预训练范式的视觉 representation。 这里的关键并不是将这些 representation 作为额外监督,而是 直接让它们成为生成模型所工作的 latent space 。编码器保持冻结,只学习后续的时间压缩模块与视频解码器,从而尽可能保留基础模型原本已经形成的语义结构。 但从图像走向视频,一个直接的问题是: 视频 representation 太“长”了 。 逐帧编码虽然可以保留丰富信息,但也意味着 latent token 数量随视频长度快速增长,生成成本难以接受;而简单地在时间维度做平均或粗粒度压缩,又容易丢掉动作信息和跨帧关系。 因此,V-RAE 引入了一个轻量级的 temporal attention pooling 模块,对连续帧的 representation 进行内容自适应聚合,在实现 4× temporal compression 的同时尽量保留语义与动态信息。随后,再通过带有 3D RoPE 的时空 Transformer decoder 将压缩后的 representation 重建回连续视频。 这一设计让我们能够在相似的 latent budget 下,真正公平地比较: 传统 reconstruction-oriented VAE latent,与 pretrained representation-based latent,究竟哪一种更适合视频生成? Representation-based latent 在视频上同样成立 实验首先回答了最基本的问题: RAE 的核心思想能否延伸到视频? 答案是肯定的。 尽管这些 representation 并不是围绕 pixel reconstruction 学习得到的,V-RAE 依然能够实现很强的视频重建性能。 在 Kinetics-600 上,V-RAE 达到 2.13 rFVD ,相比所评测的大规模预训练视频 VAE 中的最佳结果 3.58 进一步降低;在 UCF101 上,其重建性能也与最强 VAE baseline 接近。 更明显的差别来自 latent 本身包含的信息。 在 UCF101 的语义 probing 中,V-RAE latent 最高达到 90.92% 的准确率,而所评测传统 VAE latent 的最高结果只有 30.83% 。在更强调时序理解的 Something-Something V2 上,V-RAE 也达到 72.91% 。 这说明,即使经过时间压缩,pretrained representation 中已经形成的 物体、动作以及跨帧关系 仍能够被较好地保留下来。 但真正重要的问题并不是它“包含更多语义”,而是: 这些语义是否真的会让视频生成变得更容易? 更有结构的 latent,确实更容易生成 为了回答这个问题,我们进一步固定生成骨干、latent token 数量以及训练设置,只改变底层 autoencoder 所定义的 latent space。 结果显示,四种 V-RAE representation 在 UCF101 和 Kinetics-600 上均带来了更好的 downstream generation performance。 最佳模型分别达到 117.86 gFVD(UCF101) 和 19.16 gFVD(K600) 。更值得关注的是训练效率:在 UCF101 上,V-RAE 大约只需要 3 万次更新 ,就能够达到传统 VAE 约 15 万次更新 的生成水平;在 K600 上,最高观察到约 6× faster convergence 。 这一结果说明,representation-based latent 的价值并不只是“保存了更多信息”。 更关键的是,它实际上 改变了生 成器需要解决 的问题 。 在传统 reconstruction-oriented latent 中,生成模型仍需要从这些以像素恢复为目标组织起来的编码中,重新发现物体、动作与场景结构;而在 pretrained representation space 中,这些高层结构已经被显式组织出来,生成模型可以更加直接地学习: 视觉状态如何随时间发生变化 。 而在这一系列实验中,我们也观察到了一个更有意思、并且尤其值得在视频生成中重新思考的现象。 Good Reconstruction ≠ Good Generation 我们习惯用 reconstruction quality 来衡量一个 autoencoder 的好坏。 但对于生成而言,这个判断标准可能并不充分。 在实验中,不同 autoencoder 的 rFVD 与最终 generation quality 之间只有较弱相关性 。在 UCF101 上,二者的相关系数仅为
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱